推理模型瓶颈」共找到 8454 篇相关文章

算法论文8

微调已死!「共识机制」实现提示词自我进化,性能飙升

人工智能领域正从「模型微调」向「上下文工程」转变。西湖大学MAPLE实验室齐国君教授团队提出基于「共识机制」的提示词组进化算法C - Evolve,能突破单一提示词性能局限,提升系统整体性能。

量子位
算法论文8

谷歌Transformer过时了?清华姚班校友等三连击,爆改注意力!

谷歌提出新架构,参数减少40%,训练速度较RNN提升5 - 8倍,某些任务性能超Transformer 7.2%。新架构引入注意力偏向策略,用「保留」取代「遗忘」,还提出Moneta、Yaad、Memora三个新模型,在多任务上表现卓越。

新智元
新闻资讯8

刚刚,新一届ACM博士论文奖正式公布

近日,新一届 ACM 博士论文奖公布,含一个博士论文奖和两个荣誉提名。获奖论文探讨人机协作解决心理健康问题,荣誉提名论文分别聚焦计算模型局限性及大模型数据利用。

机器之心
开源动态8

全球首次实测通过!CMU华人用AI设计的乐高「不翻车」

CMU研究人员提出LegoGPT,它微调Meta的LLaMA模型,结合47000个稳定结构数据集,确保98.8%的乐高设计符合物理定律,可实际搭建。目前,数据集、代码和模型均已开源。

新智元
新闻资讯7

OpenAI这招太狠!AI从「躲猫猫」到「自爆黑料」,主打一个坦白

随着AI进入高风险场景,透明、安全变得重要。OpenAI提出「忏悔机制」,让模型回答后产出自我坦白报告,不影响主回答评分,只考察诚实,能提升不良行为可见性,目前仍处概念验证阶段。

新智元
算法论文8

ICLR 2026 | Rebuttal 是一场「带着镣铐的舞蹈」?港科 RebuttalAgent 用心智理论「读懂」审稿人

香港科技大学研究团队提出 RebuttalAgent 框架,将心智理论引入学术 Rebuttal 任务。它通过 TSR 框架拆解任务,先‘读心’再‘落笔’,能生成有说服力回复,还可作为‘思维外挂’提升小模型表现。

机器之心
推荐文章8

直播预约 | Evaluation论文分享@ICML&ACL2025

2025年6月11日20:00将直播分享Evaluation论文。多位嘉宾参与,涉及SyncPL奖励建模、文本事实一致性验证、大模型评测方法等多领域论文,涵盖模型优化、基准测试等内容。

深度学习自然语言处理
开源动态8

DeepSeek正式开源Harness:它终于有了自己的Vibe Coding入口

今晚,DeepSeek 正式发布并开源 DeepSeek Harness(DSH)开发者预览版,它是一套 Agent 运行框架。此前 DeepSeek-V4-Pro 上线,二者结合,Harness 负责将模型能力组织成可工作的 Agent,使 DeepSeek 进入相关竞争。

DeepTech深科技
算法论文7

Claude 和 Manus 还要人工搭框架?小米直接让 Agent 自我进化

6月12日小米Darwin Agent Team发布论文《HarnessX》,用“系统自进化”终结Harness人工调优时代,带来性能跃升。其让Harness成为“一等公民”,有可组合等特质,还能与模型协同进化,虽有局限但成热门方向。

AI科技评论
算法论文8

ICLR 2026 oral | AI代码真能进生产环境?SwingArena:从「写对代码Commit」到「通过CI审查」

过去一年大模型写代码能力提升,人们思考其能否参与软件工程核心流程。现有评测基准有缺失,SwingArena填补空白,将博弈引入评测,设计检索增强流水线,其开源后或成评估AI编程能力新工具。

机器之心