「多模态推理模型」共找到 8262 篇相关文章
林俊旸离职后首度发声:万字复盘,大模型下一站「智能体式思考」
前阿里千问负责人林俊旸离职后发文,复盘大模型行业演进,指出 AI 大模型未来主线是智能体式思考。文中分析推理模型崛起的启示,探讨思考与指令融合难题,还阐述智能体式思维含义、强化学习基础设施挑战等。
不只DeepSeek,阶跃等开源JetSpec:大模型解码提速近10倍
近期,DeepSeek 推出 DSpark,阶跃星辰提出 JetSpec,都关注大模型推理效率。DSpark 关注验证效率,JetSpec 提高有效 Token 生成率。二者切入点不同,但都显示大模型行业进入新阶段,推理效率成 Agent 落地基础变量。
8B模型任务击败GPT-5?阶跃星辰开源Deep Think新框架,小模型解锁百万Token测试时计算
阶跃星辰推出并行协同推理框架PaCoRe,让大模型突破上下文窗口和处理速度限制。基于此框架,小模型能解锁百万级Token测试时计算。PaCoRe - 8B在数学基准测试中超越GPT - 5,还具备前沿性能、“综合”能力涌现等优势。
VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架
VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。
大模型「越用越快」!SpeedupLLM首次验证,大降56%推理预算
Emory大学研究者提出SpeedupLLM框架,利用动态计算资源分配和记忆机制,使LLM处理相似任务时推理成本降56%、准确率提升,论文系统性验证了LLM“越用越快”,为AI模型发展提供新思路。
兼顾效率、成本与能力,百灵开源旗舰推理模型 Ring-2.6-1T
5月15日,蚂蚁百灵开源旗舰级推理模型Ring-2.6-1T,权重文件上线Hugging Face、ModelScope平台。该模型有万亿参数,‘按需思考’,在代理执行、推理机制、训练范式三方面升级,评测表现出色。
端到端语音模型:从语音表征到模型架构
本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。
微软:DeepSeek-R1等推理模型循环的原因找到了
前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型在低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。
北大开源统一世界模型框架:多类合成推理任务一套搞定
世界模型研究中,不同任务存在接口不统一等问题。北大DCAI课题组联合多方推出OpenWorldLib推理框架,整合多模态能力,构建标准化接口体系,在多任务上评估效果良好,降低研发门槛。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。