「多步推理」共找到 5589 篇相关文章
数百个虚拟人在线逃生!天大等发布:首个实时在线多智能体模拟方法
天津大学联合清华和卡迪夫大学推出RESCUE系统,把「大脑感知 - 决策 - 行动」循环搬进电脑,让数百虚拟人在线逃生。该系统能实时呈现地形等信息,还能标记身体碰撞力,可用于公共安全场景演练。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
她如何把“系统2”带给了大模型 |对话微软亚洲研究院张丽
本文是量子位对微软亚洲研究院首席研究员张丽的访谈。张丽团队在2023年开始探索大模型深度推理能力,2025年1月发布rStar - Math,用蒙特卡洛搜索算法让7B模型实现o1级数学推理能力,引发广泛讨论。
李飞飞又被超越了?百万「普通视频」打造通用4D世界模型!
全行业为昂贵多视角数据发愁时,中科院和CreateAI推出NeoVerse,用百万单目视频打开4D世界模型大门。它抛弃多视角数据和离线预处理,解决扩展性瓶颈,在重建速度、生成质量等方面表现出色,有丰富下游应用。
浙大联合北大开源 Easel:一个 Agent 包办社媒全链路,从热点发现到多平台发布!
浙江大学和北京大学联合开源Easel,这是面向社媒创作者的内容工作台,用一个Agent打通全链路,有画像驱动等六大亮点,还给出清晰的快速上手流程。
卡帕西大模型横评方法太好玩了!四大AI匿名参赛评分,最强出乎意料
卡帕西发布“大模型议会”web app,系统通过OpenRouter调起多模型开会商议,各模型答题、互评、排序,由主席模型给出统一答案。可对比模型差异,模型自评与人类主观或不同,多模型集成或成突破点。
苹果一口咬死AI不会思考!OpenAI前高管直接开怼:AGI已来,别再酸了
苹果论文《思考的错觉》挑战AI推理能力基本假设,引发争议。OpenAI前研究主管则称AGI时代已近。多项研究测试推理模型,指出其有进步也有瓶颈,未来或需换思路,评估方式也待完善。
OpenAI新模型,被曝秘密训练中!万字硬核长文直指o4核心秘密
SemiAnalysis爆料,OpenAI正训练规模介于GPT - 4.1和GPT - 4.5间的新模型,下一代推理模型o4基于GPT - 4.1训练。强化学习成推理模型进步功臣,但面临基础设施瓶颈,奖励函数难定等问题。
Monet:赋予多模态大模型如人类一般的抽象视觉思考能力
文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。
斯坦福&英伟达提出新范式:推翻Scale Law,在“推理”阶段自我进化,超越人类专家
斯坦福和英伟达提出 TTT - Discover 新范式,允许模型在测试时继续训练,针对难题‘进化’。它设计了自适应熵目标函数和 PUCT 状态复用组件,实验在多领域碾压人类专家与同行,但在部分领域落地有局限且计算成本高。