推理SOTA」共找到 2292 篇相关文章

开源动态8

腾讯开源混元世界模型1.1,视频秒变3D世界,单卡推理仅需1秒

腾讯发布并开源混元世界模型1.1,是统一的端到端3D重建基座大模型。它支持从多视图或视频一键生成3D世界,单卡秒级推理完成高精度重建,性能达SOTA,还具多特性,打破技术壁垒。

量子位
算法论文8

突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力

多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。

量子位
开源动态8

9B“小”模型干了票“大”的:性能超8倍参数模型,拿下23项SOTA | 智谱开源

智谱发布并开源仅9B大小的模型GLM-4.1V-9B-Thinking,在28项评测中拿下23个SOTA,成10B级别最佳VLM模型。它引入思维链推理机制,通过课程采样强化学习提升能力,还获10亿投资。

量子位
算法论文8

大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026

阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA

量子位
开源动态8

「百万级」视频推理数据集!30+顶尖高校联合发布

AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。

新智元
算法论文8

ICLR 2026|UIUC:一行代码彻底解决LLM推理的过度思考!

2025年DeepSeek发布推理大模型,引发RLVR研究热潮,但该方法有“过度思考”问题。伊利诺伊大学香槟分校等研究者提出Self - Aligned Reward(SAR),能提升推理准确度和效率,有望推动大模型推理系统发展。

机器之心
新闻资讯7

OpenAI自曝:AI推理砸钱越多,碾压人类越狠!

OpenAI研究员探讨推理模型时代。Noam Brown强调预训练和推理范式,指出当前AI胜在通用性。推理范式成本低、效果好,如o系列模型表现出色。首席经济学家谈AI经济影响,称其重塑企业格局。

新智元
算法论文8

DeepSeek推理最高提速6倍!开源研究:加装「思维进度条」,计算量减少30%

特拉维夫大学团队开发新方法,给LLM推理任务装进度条,控制推理深度和速度。提出“思维进度向量”TPV预测推理位置,干预TPV可“超频”“降频”,模型已在GitHub开源。

量子位
开源动态8

华为| 祭出FlashComm1,FlashComm2、FlashComm3,解决LLM推理通算瓶颈

在大模型推理面临通算难题背景下,华为数学家祭出FlashComm 1、2、3。如FlashComm 1优化AllReduce通信,提升推理性能;FlashComm 2重构计算流程,提升推理速度;FlashComm 3实现多流并行,激增模型吞吐。

AINLPer
算法论文8

从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench

港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。

AI科技大本营