推理评测」共找到 2558 篇相关文章

开源动态8

仅靠5000+样本,全新强化学习范式让30B轻松击败671B的DeepSeek V3

传统强化学习在创意写作领域举步维艰,蚂蚁技术研究院联合浙江大学开源全新强化学习范式Rubicon,构建10000+条「评分标尺」,拓展应用至主观任务领域,其30B模型用5000样本超越671B的DeepSeek V3。

机器之心
产品应用8

波士顿动力Atlas人形机器人再现逆天进化:通用AI机器人真的要来了

波士顿动力为Atlas人形机器人训练全新大型行为模型LBMs,它是语言指令驱动的策略模型,能完成复杂操作任务。构建模型有四步骤,实践遵循三大原则,还展示了其多方面操作能力与特点。

AI寒武纪
开源动态7

NextStep-1:一次在图像生成上自回归范式的探索

阶跃星辰团队探索自回归图像生成新路径,推出 NextStep-1。它直接在连续视觉空间自回归生成,架构简洁,实现端到端训练。模型有高保真生成和编辑能力,Benchmark 表现佳,但也面临稳定性等挑战。

机器之心
推荐文章8

刚刚,商汤内部两万字复盘曝光:多模态通往AGI核心路线首次公开

商汤科技联合创始人林达华撰写万字长文,剖析将「多模态通用智能」视为技术战略核心引擎的原因,探索组织及战略层面的思考。文章回顾商汤多模态之路,探讨多模态通向AGI的原因、构建路径等关键问题。

新智元
算法论文8

Attention Sink产生的起点?清华&美团首次揭秘MoE LLM中的超级专家机制

清华和美团研究聚焦MoE LLM,首次发现超级专家子集。通过多模型实证分析,揭示其分布规律、重要性及对注意力机制的影响,开发识别工具,为模型压缩提供新方向。

机器之心
8

字节Seed数学新模型,SOTA了

字节发布全新复杂数学解决模型Seed-Prover,全面超越谷歌AlphaGeometry2,在MiniF2F数据集达100%正确率。它采用引理式证明,集成几何推理引擎Seed-Geometry,还展现了卓越泛化能力。

量子位
算法论文8

真实物理加持,人物动画再也不像塑料人!UIUC华人让角色活起来了 | ICCV'25

PhysRig是UIUC与Stability AI联合提出的面向角色动画的可微物理绑定框架。它用物理建模替代传统绑定权重设计,解决传统LBS无法克服的问题,显著提升角色动画真实感,还适用于动作迁移任务。

新智元
开源动态8

媲美DeepSeek!腾讯开源新版混元模型:AI Agent强化,超30种智能体指令

腾讯开源混元大模型最新版本Hunyuan - A13B,为专家混合模型,有800亿参数,130亿激活。支持快慢思考模式,针对AI Agent强化,设计超30种智能体指令。测试成绩超DeepSeek - R1等,架构和训练有优化。

AIGC开放社区
7

OpenAI连丢4位大将!Ilya合作者/o1核心贡献者加入Meta,苏黎世三人组回应跳槽:集体做出的选择

OpenAI连失4员大将,Trapit Bansal跳槽Meta,继续研究推理大模型;苏黎世三人组Lucas Beyer等也加入Meta。此外,Meta还在洽谈收购语音AI初创公司PlayAI,连续布局语音AI。

量子位
算法论文8

北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1

北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。

量子位