「视觉语义场景补全」共找到 2593 篇相关文章
让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」
在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。
自动化浏览器
Skyvern是能自动化浏览器操作的工具,底层靠大语言模型和计算机视觉。它提供简单API接口,可在大量网站自动化手动操作,替代易出错的自动化方案。介绍了其原理、使用方法、功能等。
独家丨滴滴悄咪咪上线了个「AI 图寻」产品
2013 年 GeoGuessr 地理猜测游戏走红,衍生出「图寻」玩法。2024 年 AI 让“猜地点”能力大增。今年滴滴悄悄上线 AI 图寻产品「在哪儿问问」,具实用工具属性,但 AI 识图在冷门场景表现欠佳。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
斩获6.1 star,再见Crontab!这款开源定时任务管理系统让运维更高效
Gocron是基于Go语言的轻量级定时任务管理系统,可替代Linux Crontab。它有可视化界面、秒级调度等功能,适用于自动化运维等场景,通过Docker一键部署,比同类项目更具优势。
中国造出一颗「不怕死」的AI大脑,专接最要命的活儿
全球首个搭载AI大脑的防爆机器人“若愚揽月01”接管加油站,其“若愚九天”机器人大脑深度整合多模块,采用双系统,实现“脑+体”合一,可迁移至多场景,成立三年成果显著,欲做机器人时代“智能内核”。
前端开的同学,天塌啦,AI把前端开发最后一公里给补上啦,不敢相信,太夸张啦~~~
Vercel Labs 开源的 agent - browser,是面向 AI Agent 的无头浏览器自动化 CLI。它解决了 AI 前端开发缺真实浏览器验证交互的问题,适用于多场景,有诸多对 AI 友好的特性,还介绍了使用方式。
Gamma完美开源平替,输入主题一键生成专业PPT,配图排版全自动!
做PPT耗时耗力,现有AI驱动PPT生成工具多为闭源SaaS服务。GitHub上的开源项目presentation-ai是Gamma的开源平替,输入主题可自动生成PPT,功能丰富,还给出安装部署步骤和使用场景。
开源2天斩获3K标星!开源TTS新星Chatterbox盲测击败ElevenLabs!
文本转语音(TTS)技术发展快,但达顶尖水平仍有挑战。开源TTS新星Chatterbox,开源2天冲上GitHub热榜,星标超3K。它功能亮点多,安装简单,适用于多种场景,性能超ElevenLabs。
Claude Opus 4.7 发布!留给人类的时间,不多了
Anthropic 发布 Claude Opus 4.7,核心升级是让 AI 跑长且复杂任务,还能自我验证结果。它视觉能力超强,编程能力提升,新增 /ultrareview 功能,API 多了调节档,不过 token 数量或增加,成本可能上浮。