「新注意力机制」共找到 4298 篇相关文章
长上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破
月之暗面团队的Kimi Linear模型,是混合线性注意力架构,核心是Kimi Delta Attention模块。它解决线性注意力的记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效长上下文模型研究。
三星研究院发布手机端侧大模型MeKi:基于Memory的LLM扩展新范式,支持旗舰手机端侧部署
三星研究院发布端侧大模型架构MeKi,提出用存储空间扩展模型容量、提升LLM性能的新范式。它利用手机ROM缓解内存压力,实现容量与性能提升。实验显示其性能、效率表现优,为边缘部署LLM提供新思路。
中国首次提出半导体演进新原则:华为“韬定律”5 年内冲刺等效1.4nm制程,麒麟、昇腾将先后落地量产
5月25日,华为何庭波在ISCAS 2026上提出“韬定律”,以“时间缩微”替代“几何缩微”。论文展示验证案例,预计2031年高端芯片晶体管密度达1.4nm等效水平,今年秋季麒麟新芯片将首发“逻辑折叠”技术。
Cursor 1.5T新模型放弃Kimi基座!600亿美元股票换Cursor,马斯克第一刀砍向微软GitHub
SpaceX官宣收购Cursor,后者获600亿美元股票。Cursor在Compile大会发布1.5T新模型和Origin平台。新模型规模大、从零训练、算力提升;Origin是面向智能体的Git平台,将与GitHub竞争。
Claude Opus 4.7发布:更强能力,自我纠错,越来越不需要人类干预了
Anthropic发布Claude Opus 4.7版本,搭配Routines功能可自动化工作,减少人类干预。该版本能力大幅增强,还引入新护栏机制保障安全,推出新运算级别和任务预算功能。
2篇最新论文,把Deep Research讲透了~
阿里开源Tongyi DeepResearch热度高,文章分享两篇相关技术综述。介绍Deep Research是代理研究新范式,阐述其四大核心模块、优化方法、数据处理、奖励机制,还提及开源系统亮点及相关论文。
Claude爆火研究漏引华人团队成果,已挨打立正道歉
Anthropic新论文研究Claude“情绪机制”,漏引华人团队Chenxi Wang去年10月论文。经沟通,A社已道歉并更新博客引用。华人团队论文首篇系统研究LLMs情绪机制,解答核心问题,成果显著。
拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”
现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。
上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026
上交大与 vivo 团队提出 C²FG 方法,针对当前 diffusion 模型缺稳定可控生成机制问题,通过 score 差异实现动态引导控制。实验显示,该方法能提升多维度指标,改进生成分布,揭示生成机制新方向。
高效大规模创新3D重建模型iLRM
多数基于Transformer架构的模型处理多视图输入有可扩展性问题,成均馆大学、延世大学研究人员提出创新3D重建模型iLRM。它通过迭代细化机制生成3D高斯表示,有独特架构设计和高效注意力机制。