自注意力层」共找到 1527 篇相关文章

算法论文8

清华、快手提出AttnRL:让大模型用「注意力」探索

清华和快手团队提出新框架AttnRL,引入注意力机制提升过程监督强化学习效率与性能。它解决传统方法在分支位置选择和采样策略上的效率问题,实验显示在多基准测试中表现优异。

机器之心
推荐文章7

AI 时代,产品经理的“翻译”正在消失

随着AI能力进化,产品经理在用户和工程师间的‘翻译’正坍塌。工作效率从周变小时,模式从写规格书变为用Agent做原型。PM需掌握定义问题等新技能,转变思维,虽部分场景适用,但有组织阻力。

宝玉AI
新闻资讯7

OpenAI也缺卡!僧多粥少,曝内部抢卡抢到发疯

OpenAI正面临绝对的算力稀缺,总裁Greg Brockman曝内部算力资源争夺严重。算力是创新根本驱动力,因资源有限,许多产品无法发布,如ChatGPT Pulse部分功能仅对Pro用户开放。OpenAI有资源分配机制,但平衡各团队需求不易。

量子位
新闻资讯7

刚刚,Ilya Sutskever宣布任CEO:联创被Meta挖走了

周五凌晨,OpenAI 联合创始人 Ilya Sutskever 宣布任 Safe Superintelligence(SSI)首席执行官,原 CEO Daniel Gross 已退出。此前有 Meta 欲收购 SSI 的传闻,Gross 或转去 Meta 负责人工智能产品。

机器之心
新闻资讯7

苹果AI研不动,库克外包给谷歌Gemini了

今天凌晨,苹果与谷歌官宣达成深度合作协议,基于Gemini模型和谷歌云技术构建下一代苹果基础模型,成果之一是今年内上线“更个性化的Siri”。此前苹果研AI推进不顺,人才流失严重。

量子位
算法论文8

ICML 2026 | Agentic强化学习训练的信息锁问题

随着大语言模型走向真实交互,强化学习训练LLM agents时出现信息锁问题。香港中文大学等研究者分析其原因并提出AREW方法,在多场景实验中表现稳定且具鲁棒性。

机器之心
产品应用8

面壁MiniCPM-SALA模型,稀疏-线性注意力,单卡吞吐百万上下文

面壁智能团队提出SALA,基于此训练的MiniCPM-SALA模型,在单张A6000显卡实现百万token超长上下文推理,训练成本降约75%。它结合稀疏与线性注意力,采用混合架构,继承权重降低成本,在长文本处理上优势明显。

AIGC开放社区
新闻资讯7

苹果或搁置研模型,转向依赖OpenAI或Anthropic

苹果正考虑用第三方AI模型驱动Siri,这是其在AI竞赛中的重大转向。目前苹果多为研技术,评估外部模型项目已启动,虽未做最终决定,但或借此摆脱AI落后声誉。网友对此看法不一。

AGI Hunt
算法论文8

从静态模型到数字生命体:进化AI Agent综述

近年大型语言模型催生AI智能体发展,但现有系统依赖人工预设,难适应动态环境。论文提出进化AI智能体,可通过环境反馈动优化,还提出三定律、四阶段范式演进模型等,开源EvoAgentX框架。

深度学习自然语言处理
新闻资讯8

比肩英伟达H20!阿里研PPU浮出水面

1月29日,阿里旗下平头哥官网公布高端AI芯片“真武810E”信息,标志“通云哥”协同体系亮相。该芯片全栈研,已服务超400客户。其PPU架构性能比肩英伟达H20,性价比更高,阿里还支持平头哥探索独立上市。

芯师爷