无注意力模型」共找到 8053 篇相关文章

算法论文8

AI失忆术!只需3个注意力头,就能让大模型忘记「狗会叫」

Meta和纽约大学团队发布论文《From Concepts to Components》,提出SAMD和SAMI方法。前者定位模型概念注意力模块,后者微调强度。能让模型‘失忆’,还可增强推理、控制安全,为AI研究开新方向。

新智元
产品应用8

突破遥操瓶颈!全新本体数据世界动作模型Noe-0发布

穹彻智能发布世界动作模型 Noe - 0,全链路采用本体采集数据。其数据来自真实环境,配合 World Action Model 架构和 AI - Native 数据基础设施,跑通从真实世界经验到机器人能力转化的完整链路,是具身智能的里程碑。

机器之心
新闻资讯8

汪军对话 Rich Sutton:大模型在一定程度上分散了我们对智能理解的注意力

在RL China 2025开幕式上,汪军与图灵奖得主Richard Sutton对话。Richard认为大模型缺乏目标和奖励,分散对智能理解的注意力。他强调RL核心是从经验学习,智能原则含梯度下降等,建议将目标解读为“奖励”。

AI科技评论
推荐文章7

万字长文!大模型LLM推理优化技术总结

文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。

OpenMMLab
算法论文8

预训练模型拿下ARC-AGI榜三!Mamba作者用压缩原理挑战Scaling Law

CompressARC研究中,Mamba作者Albert Gu团队给出不同于大规模预训练的智能配方——最小描述长度(MDL)。一个76K参数、预训练模型,在ARC - AGI - 1基准解决20%问题,获ARC Prize 2025第三名。

量子位
算法论文8

颜水成领衔,给AI分段位!超100款多模态模型人达到L5

十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,L5模型,揭示当前模型不足。

新智元
算法论文7

模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
算法论文8

年度AI论文!全球三大顶尖模型的防蒸馏机制全面告破:小模型“套出”大模型隐藏思维链,Kimi-K3重现概率异常

这篇论文指出三大前沿AI模型厂商API有密码学旁路漏洞,攻击者用轻量级模型就能恢复大模型隐藏思维链数据。还揭示部分模型训练或借鉴大模型思维链,此漏洞也致企业数据隐私安全问题。

AI前线
算法论文8

ICLR 2026 Oral | 没人诱导,大模型也会「骗人」

新加坡国立大学 Bingsheng He 教授团队论文关注诱导下大模型是否诚实。设计 CSQ 框架测 16 主流模型,发现问题越难模型越易不诚实,能力强也未必更诚实,还揭示 silent fabrication 现象。

机器之心
产品应用7

抢先李飞飞!世界模型能多人联机玩FPS游戏了

Odyssey公司推出世界模型Agora - 1,驱动网页版多人FPS游戏,游戏引擎等,画面实时生成。该公司专注通用世界模型,此前业务转向主动交互,此成果解决多人游戏一致性难题,还发布多模态模型Starchild - 1。

量子位