视觉重建」共找到 762 篇相关文章

产品应用7

全球首款AI原生游戏引擎再进化:GTA6再不来,我们就AI一个

GTA 6跳票成梗,其场景常被用于研究。一个多月前全球首个AI原生UGC游戏引擎发布,如今Mirage迭代为更强大的Mirage 2,支持多样场景,与Genie 3有不同优势且已上线,不过仍有技术问题待解决。

机器之心
新闻资讯7

95后北大校友挑起ChatGPT Agent大梁!今年刚博士毕业,曾获陶哲轩支持的AIMO第二名

OpenAI发布ChatGPT Agent项目,奥特曼重视有加,让两个华人挑大梁。孙之清从技术介绍强化学习训练,Casey Chu谈人类与Agent合作。孙之清是95后北大校友,Casey Chu领导过GPT - 4视觉输入原型开发。

量子位
开源动态8

超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型

现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。

机器之心
算法论文7

现实世界的天气能复刻?Weather-Magician实时渲染下雨打雷下雪

传统工业方法在还原复杂现实场景时成本高、质量差,当前算法也难重建和渲染真实天气效果。上海交通大学提出Weather - Magician框架,能重建场景并渲染4D天气效果,对硬件要求低且可实时渲染。

带你学AI
新闻资讯8

Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!

Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。

AGI Hunt
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。

CourseAI
推荐文章8

评论送书 | 想系统了解AI?先搞清楚这四件事

文章围绕系统了解AI需搞清楚的四件事展开,介绍了AI理论基础层的机器学习和深度学习,感知交互层的计算机视觉等,应用实践层的机器人学等,还提及伦理社会层的AI伦理和社会影响研究。

AIGC开放社区
算法论文8

无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案

近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。

机器之心
产品应用7

让AI接管我家:钢铁侠有的,我也能有

作者邓天卓分享用AI重建家庭数字生活的经历。从迁移20年数据,到让AI控制家电、汽车,还能排查电脑木马、整理照片等。虽AI有不足,但技术已能把科幻变成日常,家庭AI工作站可慢慢搭建。

AI科技评论
推荐文章8

Anthropic Labs 负责人:AI 时代做产品,最大的陷阱是「做太多」

Anthropic Labs 负责人 Mike Krieger 在播客中探讨 AI 时代产品建造问题。他以重建 Bourbon 为例,指出 AI 加速开发有弊端,还分享产品易过度建设、需接受重写等观点,也谈到团队结构、企业客户矛盾等内容。

AGI Hunt