「视角 - 动作对齐」共找到 681 篇相关文章
训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限
NVIDIA、港大、MIT团队提出Sol - RL,采用「FP4先探索、BF16再训练」框架,将扩散模型训练收敛速度最高提至4.64x,在速度与对齐效果间给出工程可行解法。
先解行为,再训Agent:CMU开源首份Agentic Search日志数据,把Agent拆开给你看
CMU团队基于DeepResearchGym平台,从半年真实流量中整理出数据,构建并在Hugging Face开源首个Agentic Search行为日志数据集。还提出三层分析框架,刻画智能体搜索行为,为研究和系统设计提供基础与信号。
高效智能体的「幕后推手」是谁?一篇综述带你从记忆×工具学习×规划看透
随着大模型能力提升,业界关注智能体落地,而高效性是决定能否上线的‘硬’问题。论文梳理‘高效智能体’综述,从记忆、工具学习、规划三机制出发,还谈及基准评测、挑战与展望。
比Gemini 3记得更多,谷歌新框架将上下文记忆干到了200万!
Google在NeurlPS2025大会推出结合RNN与Transformer的全新架构Titans,能扩展到超200万个token上下文。背后涉及Titans和MIRAS两篇论文,共同推进测试时记忆概念,实验显示新架构性能出色。
英伟达新架构引爆全模态大模型革命,9B模型开源下载即破万
英伟达推出全模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。
特斯拉下一代金色Optimus原型现身?一双「假手」成为最大槽点
Salesforce CEO发布与金色Optimus对话视频,盛赞其开启物理智能体革命。不过,其高昂价格、“假手”设计引争议。对比Figure机器人精准装碗视频,特斯拉Optimus表现不尽如人意,是否遇麻烦引人猜测。
6秒造一个「视频博主」,Pika让一切图片开口说话
8月11日,Pika推出“音频驱动表演模型”,允许用户上传音频结合静态图片生成高度同步视频,角色口型、表情、动作自然,平均6秒出720p高清视频,目前仅限iOS端且需邀请码。
Anthropic CEO最新采访:AGI一词毫无意义、点名扎克伯格、谈开源、家庭……等八个非共识观点
Anthropic CEO Dario Amodei在采访中给出八个非共识观点。他认为AGI和ASI是空洞概念,年亏30亿美元是投资,开源作用被高估,还谈及公司应对挖角、竞争、市场定位等策略,展现独特领导风格。
DeepMind夺得IMO官方「唯一」金牌,却成为OpenAI大型社死现场
谷歌DeepMind宣布其Gemini进阶版模型在IMO竞赛达金牌水平,解决五道超高难度试题,首次证明AI仅靠自然语言理解就能攻克复杂数学难题。其谨慎发布方式获赞誉,与OpenAI形成鲜明对比。
DreamArt!只需一张图,生成可动的可交互物体
生成可动物体是具身智能等领域关键挑战,现有方法有局限。北大团队提出DreamArt框架,从单张图像生成可交互可动物体,经三阶段流程,表现优于基线方法,不过也存在生成不符物理规律等问题。