通用推理模型」共找到 8317 篇相关文章

算法论文8

DeepSeek点燃大模型效率之争,阶跃火速接棒:JetSpec让大模型解码速度最高提升近10倍

近期,DeepSeek发布DSpark,阶跃星辰发表JetSpec论文,二者聚焦大模型推理效率。DSpark关注验证效率,JetSpec从Draft生成本身入手。结果显示,二者都有加速效果,共同表明推理效率正成Agent落地关键变量。

量子位
开源动态8

罗福莉执掌小米大模型首秀!定调下一代模型,全新MiMo-V2开源还横扫Agent第一梯队

在2025小米人车家全生态合作伙伴大会上,罗福莉首秀解读全新大模型MiMo - V2 - Flash,该模型已开源,采用MoE架构和MTP技术,在多方面表现出色,罗福莉还阐述其设计逻辑与对下一代智能体的看法。

AI前线
算法论文8

JustGRPO:扩散语言模型的极简主义回归

本文提出回归极简的方法 JustGRPO,在 RL 阶段让模型自回归生成,用标准 GRPO 训练,能超越各类针对 dLLM 设计的 RL 算法表现,提升推理表现同时保留并行解码能力。

机器之心
推荐文章7

Learn to Reason _ The way of Baichuan-M1-ClinicReasoning

前百川智能研究小组负责人阎栋分享大语言模型临床推理。回顾推理技术发展,以Deepseek为例;介绍百川在医疗推理实践,模型达三甲主治水平;还谈及大模型训练困境及与人类智能差异。

InfoQ
推荐文章8

陶大程技术博客首发:从像素复刻到行动控制,具身世界模型的底层逻辑探索|甲子光年

今年世界模型成AI热点,通用世界模型追求像素逼真,具身世界模型不同,其使命是支撑行动。文章拆解具身世界模型底层逻辑,分享开悟世界模型的技术设计与实践思考。

甲子光年
开源动态8

打破大模型编程「数据污染」与「能力虚胖」困境,Meituan-M17团队构建新一代AI编程评测新标准——OIBench

当前大语言模型编程能力评估体系问题多,如评测集饱和、数据泄漏等。Meituan - M17团队推出OIBench数据集,对18个主流大模型评测,揭示模型真实水平,还将举办人机协作编程竞赛。

机器之心
算法论文8

Meta「透视」AI思维链:CRV推理诊断,准确率达 92%!

Meta FAIR团队在论文中提出CRV方法,可实时观察AI思维过程。它通过改造模型大脑结构,让推理可见。在算术推理实验中,检测精度提升到92.47%,还能让模型修正错误。不过该技术落地尚面临诸多挑战。

新智元
算法论文8

腾讯提出“我思故我玩”Agent:LLM构建推理与规划世界模型

腾讯与武大联合发表论文提出 CEL 新型 Agent 架构,通过 LLM 驱动两阶段循环实现“思考式学习”。它能填补传统方法短板,在小游戏实验中表现出色,有可解释性等优势,但也有实验环境局限等问题。

深度学习自然语言处理
算法论文8

扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
新闻资讯7

GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem

北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。

新智元