算法论文8
腾讯混元等:E - GRM 让奖励模型智能分配算力
InfoQ
AI 摘要
腾讯混元与新南威尔士大学:提出 E - GRM 框架,把模型不确定性变为调度信号,按需推理。在 MATH 数据集实验中,延迟降 62%、FLOPs 降 49%,准确率升 3.3%,为大模型高效部署提供方法。
阅读原文 · InfoQ
大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026
生成式奖励模型(GRM)推理策略存在算力浪费问题。腾讯混元与新南威尔士大学联合提出 E - GRM 框架,将模型不确定性定义为调度信号,按需推理。文章从多维度解读该框架,并展示实验评估结果。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
0.01%参数,大模型低数据微调新方案
瑞典隆德大学与Google DeepMind团队研究大模型微调省参方案。发现低数据场景下,微调Value投影中的b(v)比b(q)或b(k)性能更好。该研究已被ACL 2026接收,集成进Hugging Face - PEFT库。
量子位
开源动态7
伯克利开源SkyPilot转型初创,剑指AI编排
前沿模型团队算力瓶颈从不足变为分散,开源AI算力调度项目SkyPilot应运而生。7月末,它从高校走出成为初创公司,完成2000万美元种子轮融资。其免费版与商业版各有侧重,切入AI编排赛道潜力大。
DeepTech深科技
算法论文8
腾讯混元:SFT训练有15.3%“假学会”样本
大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。
量子位
算法论文8
浙大&阿里:让AI先思考再生成图像
当下视觉生成中,开源模型在逻辑推理生成任务上频频翻车,与闭源模型有差距。浙大与阿里团队提出Unified Thinker,将思考与执行解耦,构建数据集、采用创新算法,实验显示其有效提升逻辑执行准确度。
量子位