新视角合成」共找到 3869 篇相关文章

算法论文8

VEGA-3D:释放视频生成模型中的隐式3D知识,重塑3D场景理解与具身交互

华中科技大学与百度联合提出VEGA - 3D,释放视频生成模型隐式3D知识。它将视频生成模型作‘潜在世界模拟器’,用自适应门控融合机制,提升场景理解等任务表现,无需额外3D标注数据。

机器之心
推荐文章8

转载 | 鄂维南院士:关于推动AI从工程化走向科学化的一点思考

鄂维南院士探讨推动AI从工程化走向科学化。回顾AI先驱,指出基础理论滞后致发展起伏、大模型开发依赖经验。介绍AI主要方法,分析深度学习基础理论问题,强调从系统角度看待AI,认为已到科学化转折点。

力学与人工智能
算法论文8

上交大54页综述讲透Agent认知外部化的演进之路

上海交大联合多机构提交综述论文,首次以「外部化」为统一视角,梳理了LLM Agent的记忆、技能、协议与Harness工程四大支柱。指出Agent实际进展取决于外部认知基础设施,而非模型能力提升。

机器之心
开源动态7

用Claude Code剪视频,自动去口癖、加字幕、调色,完全免费开源

browser - use团队开源Claude Code技能video - use,可自动去口癖、加字幕、调色等。它通过转录文本和按需视觉合成图让LLM理解视频,有完整流水线和设计原则,还给出使用方法。

AI寒武纪
产品应用7

Claude Opus 4.7,全网差评!刚升级就翻车,用户怒斥:还我4.6

Claude Opus 4.7刚发布就遭全网吐槽,价格贵50%,性能却严重倒退,出现幻觉、计算拉胯等问题。用户质疑Anthropic为省钱缩水模型,罪魁祸首可能是引入的“自适应推理”功能。

新智元
新闻资讯8

在ICLR 2026主会之前,我们和30多位入选者聊了聊最前沿的AI细节

4月14日,智源社区、DeepTech联合举办ICLR 2026预讲会。会议聚焦顶会核心精华,三十余位论文作者分享AI Agent、大语言模型等热门领域成果,展示解决大模型痛点的研究。

DeepTech深科技
新闻资讯7

谷歌DeepMind设立首个AI哲学家岗位,解决AGI伦理困境

谷歌DeepMind设全职哲学家岗位,由剑桥学者Henry Shevlin出任。当下人们对AI恐惧渐入现实,而大众常用AI让AI意识成社会问题,这凸显了哲学家解决AGI伦理困境的必要性。

新智元
算法论文8

性能提升400%!AutoResearchClaw自主设计多模态记忆大脑

AI助手积累海量多模态数据,记忆和提取成瓶颈。北卡罗来纳大学等团队用AutoResearchClaw让AI 72小时完成多模态记忆系统设计,性能提升超400%,系统OMNIMEM全面碾压现有主流系统。

AIGC开放社区
产品应用7

谷歌翻译功能上线 iOS:支持任意耳机,实时听懂70+语言

谷歌翻译耳机实时翻译功能正式登陆 iOS,在 iOS 和 Android 端覆盖范围扩大,增多国市场,支持超 70 种语言。打开 App 连接耳机即可实时听懂对方说话,适用于家庭和出行场景。

AI寒武纪
产品应用8

别人都在卷视觉,这家具身公司偏要卷“手感”

非夕科技坚持力觉优先路径研发具身智能,过去十年专注自研机械臂,产品应用广泛。此次推出Enlight初昕系列机械臂和MICO双臂机器人平台,还构建模块化产品生态,定位通用机器人基座平台,为具身智能落地打基础。

量子位