视觉交互」共找到 1212 篇相关文章

算法论文8

世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

Aether AI与加州大学圣地亚哥分校研究发现现有世界模型会无视动作控制信号,根源是隐动作模型受视觉混杂因素污染。团队提出CD - LAM,从上游净化隐动作表征,实验显示其能降动作误差、提画面质量,降低后训练开销。

机器之心
产品应用8

豆包 Seed 2.0 来了:字节模型跨越鸿沟

春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。

MacTalk
7

杨植麟预告,Kimi K3要来了

月之暗面团队海外AMA透露Kimi K3相关信息。K3或采用KDA架构,有低成本优势;通过开源解决信任问题;将推出不同规格模型;产品打磨注重写作、视觉能力及NSFW内容探索。Kimi性价比模式或改写行业规则。

AI产品自由
开源动态8

腾讯发布混元3D世界模型1.0:首个支持物理仿真的开源世界生成系统

在2025年世界人工智能大会上,腾讯发布混元3D世界模型1.0,它是首个开源且兼容传统CG管线的可漫游世界生成模型。可通过文图生成3D世界,支持编辑、仿真,有360°沉浸、工业兼容、原子级交互优势。

量子位
算法论文8

坏了,我成AI的乙方了!Anthropic论文爆火,谁还敢无脑Copy?

Anthropic开年论文实锤AI让程序员变傻,用AI辅助的人比纯手写只快2分钟,且测验平均分低17%。研究将工程师使用AI的交互行为归纳为五种模式,指出主动拷问AI才能进化,高分者会主动制造障碍。

新智元
产品应用8

终于在国产AI上看到了Opus的影子|GLM-5深度实测

作者起初怀疑GLM - 5称对标Claude Opus 4.6、定位“系统架构师”的说法,但实测后改观。通过宝可梦策略助手、降噪网站沉浸式交互、求职招聘双边匹配三个测试,展现其系统规划、执行、纠错等能力,像真正架构师。

AI产品黄叔
新闻资讯8

GAIR 2025 世界模型分论坛:从通用感知到视频、物理世界模型的百家争鸣

第八届GAIR全球人工智能与机器人大会世界模型分论坛上,五位青年学者围绕世界模型展开精彩演讲,话题涵盖通用感知、三维技术等。他们的研究为世界模型领域带来不同启发,目前该领域研究尚处起步阶段,共识未形成。

AI科技评论
产品应用7

8个月营收提高4倍,n8n如何成为AI Agent最受欢迎的搭建平台?

n8n由前《加勒比海盗》视觉设计师创立,从工作流自动化工具升级为AI应用编排层。8个月营收提4倍,正进行超1亿美元融资。它能与AI无缝集成,有活跃社区,在多场景应用广泛,不过用户多为技术人员。

Founder Park
算法论文7

把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。

AI科技评论
产品应用7

交互式世界模型来了:不止理解世界,更要改造世界

8月17日,智象未来发布交互式世界模型HiDream - O1 - World,定位为全球首款原生全模态交互式世界模型。它提供漫游和编辑两种交互方式,在WBench测试中成绩优异,但开放场景表现待验证。其采用独特生成方式,有广阔应用前景。

DeepTech深科技