算法论文8
南科大团队定位大模型「作弊」神经回路
量子位
AI 摘要
南科大等团队研究发现,大模型用虚假奖励训练时,会激活记忆捷径,出现‘困惑度悖论’,关键在第18 - 20层。还能操控记忆,成果为评估、检测和去污染提供新方法。
阅读原文 · 量子位
定位大模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆
此前学术界发现大模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科大等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
英伟达推理指南:华人团队方案成最优解
9月2日,英伟达技术博客上线《用投机解码做AI模型协同设计》,给出推理加速选型表。列入指南的核心方案多由华人团队主导,介绍了从外置草稿模型到n - gram查表法等方案,还提到硬件常数对模型架构的约束。
新智元
新闻资讯7
Meta发布Muse Spark 1.3,挑战谷歌模型
九月刚过3天就有五个前沿模型发布,Meta发布Muse Spark 1.3踢馆谷歌Gemini 3.8 Flash。它跑分提升大、成本低,性价比高,但也遭质疑,大模型下半场或比拼系统架构和智能体工程能力。
新智元
新闻资讯8
陈大年复出,小模型StartLux挑战大参数量模型
国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。
量子位
开源动态8
E - Commerce Bench揭秘大模型网店经营能力
为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。
千问大模型