全身视觉运动控制」共找到 742 篇相关文章

新闻资讯8

L4大方向有了:理想自动驾驶团队,在全球AI顶会上揭幕新范式

在全球计算机视觉学术顶会 ICCV 2025 上,理想汽车自动驾驶高级算法专家詹锟发表演讲,阐述了‘从数据到训练’的系统化思路,提出将世界模型与强化学习闭环落地于量产自动驾驶系统的完整架构。

机器之心
算法论文8

港科广×腾讯联手打造《我的世界》神操作,400张截图就能让AI挖矿通关,成本降至5%|EMNLP 2025

港科广与腾讯联合团队提出VistaWise框架,将“跨模态知识图谱+轻量化视觉微调”引入开放世界智能体。实验显示其在“获取钻石”任务表现出色,成果被EMNLP 2025主会录用。该框架以低成本、跨模态为突破口。

量子位
产品应用7

全球首款AI原生游戏引擎再进化:GTA6再不来,我们就AI一个

GTA 6跳票成梗,其场景常被用于研究。一个多月前全球首个AI原生UGC游戏引擎发布,如今Mirage迭代为更强大的Mirage 2,支持多样场景,与Genie 3有不同优势且已上线,不过仍有技术问题待解决。

机器之心
新闻资讯7

因为GPT-5,这群人决定在Reddit上起义。

OpenAI上线GPT - 5时下架旧模型,引发用户不满。在Reddit等社区,用户掀起“还我GPT - 4o”运动,大媒体跟进。奥特曼改口,GPT - 4o回归部分付费用户,免费用户需充值。开发者与用户存在认知鸿沟。

数字生命卡兹克
新闻资讯7

95后北大校友挑起ChatGPT Agent大梁!今年刚博士毕业,曾获陶哲轩支持的AIMO第二名

OpenAI发布ChatGPT Agent项目,奥特曼重视有加,让两个华人挑大梁。孙之清从技术介绍强化学习训练,Casey Chu谈人类与Agent合作。孙之清是95后北大校友,Casey Chu领导过GPT - 4视觉输入原型开发。

量子位
开源动态8

超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型

现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。

机器之心
产品应用8

Midjourney正式推出 V1 视频模型:美学细节无敌

Midjourney推出视频生成模型V1,主打高性价比、易上手。采用“图像转视频”工作方式,有两种动画和运动幅度设置。入门价每月10美元,任务成本低,未来一月或调价格,目标是实现实时交互开放世界模拟系统。

AI寒武纪
新闻资讯8

Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!

Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。

AGI Hunt
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。

CourseAI
推荐文章8

评论送书 | 想系统了解AI?先搞清楚这四件事

文章围绕系统了解AI需搞清楚的四件事展开,介绍了AI理论基础层的机器学习和深度学习,感知交互层的计算机视觉等,应用实践层的机器人学等,还提及伦理社会层的AI伦理和社会影响研究。

AIGC开放社区