「推理论文」共找到 2861 篇相关文章
0.5B以小搏大拿下端侧模型新SOTA:4090可跑,长文本处理5倍常规加速丨清华&面壁开源
清华大学和面壁智能团队开源MiniCPM 4,有8B、0.5B两种参数规模,以22%训练开销达同级别最优。它在架构、推理、数据、训练多方面创新,性能领先,适用于综述生成、工具调用等场景。
SmolVLA: 让机器人更懂 “看听说做” 的轻量化解决方案
文章介绍轻量级开源视觉 - 语言 - 动作 (VLA) 模型 SmolVLA,专为机器人领域设计,可在消费级硬件运行。它用公开数据集训练,架构经优化,还引入异步推理堆栈,性能超部分大模型,降低研究门槛。
新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o
过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。
百度想明白了:旧供给到达极限了
当下企业应用AI时,Token成本高、推理效率低问题凸显。百度Create大会释放旧供给达极限信号,推出新全栈AI云,含Agent Infra和AI Infra两层架构,多个场景应用初显成效。
Agentic的风又吹到了世界模型~
这篇42位作者联合完成、综述400余篇工作的论文,第一次用'能力×法则'双轴框架,把所有叫'世界模型'的系统放到同一张地图上,为领域建立公共语言,还得出了关键结论。
黄仁勋做客美国第一播客:每天都在担心英伟达倒闭
英伟达CEO黄仁勋做客美国第一播客Joe Rogan,畅谈AI底层逻辑与技术演进,还分享英伟达创业历程。他指出AI已从检索转向推理,数据中心成“AI工厂”,并坦言每天担心公司倒闭。
陈丹琦新作:大模型强化学习的第三条路,8B小模型超越GPT-4o
陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。
Scaling Laws起源于1993年?OpenAI总裁:深度学习的根本已揭秘
人工智能扩展定律(Scaling Laws)把模型性能和资源投入联系,是构建大模型的参考标尺。其起源说法不一,康奈尔博士生将其推至1993年贝尔实验室论文,OpenAI总裁称它揭示深度学习根本。
Transformer终结者!谷歌DeepMind全新MoR架构问世,新一代魔王来了
KAIST、谷歌DeepMind等机构发布的MoR架构,推理速度翻倍、内存减半,重塑LLM性能边界,碾压传统Transformer。它融合参数共享与按需计算,有路由和KV缓存策略,实验显示其性能优越、可扩展性好。
陶哲轩转发!DeepMind开源「AI数学证明标准习题集」
DeepMind开源形式化数学猜想库,收录经典数学猜想,还提供代码函数方便形式化表述。此库可作测试基准提升AI数学推理能力,是AI+ATP范式关键前置步骤,团队邀更多人参与丰富内容。