新注意力机制」共找到 4297 篇相关文章

产品应用8

编程王Composer 2.5来了,逼近Opus 4.7!成本仅为1/10

Cursor推出全AI编程模型Composer 2.5,在部分编程基准测试上接近Claude 4.7 Opus和GPT - 5.5,运行效率最高提升10倍,成本仅为竞品一小部分。其采用定向文本反馈RL等机制,还与SpaceXAI合作冲击百万H100集群算力。

新智元
算法论文8

条条电路通罗马:大模型可解释性的「唯一机制」可能从一开始就不存在

长期以来,机制可解释性领域默认模型对同一任务的能力对应唯一内部「电路」。但被ICML 2026接收的论文指出,「唯一电路」可能不存在,同一任务可由多个结构不同但能力相当的电路完成。

机器之心
推荐文章8

万字长文!大模型(LLM)推理优化技术总结(非常详细)

文章聚焦大模型推理优化技术,介绍推理过程分预填充与解码阶段,还阐述模型并行、注意力机制优化、模型优化及服务技术等,如多查询注意力减少内存,FlashAttention 优化计算顺序。

AINLPer
算法论文8

DiffMoE:动态Token选择助力扩散模型性能飞跃,快手&清华团队打造视觉生成标杆!

清华大学和快手可灵团队推出DiffMoE,通过创的动态token选择机制和全局token池设计,拓展了扩散模型的效率与性能边界。实验表明,DiffMoE在多方面超越现有模型,未来集成先进技术或有增益。

机器之心
算法论文8

单GPU搞定高清长视频生成,效率×10!引入Mamba机制突破DiT瓶颈 | 普林斯顿&Meta

普林斯顿大学和Meta联合推出框架LinGen,以MATE线性复杂度块取代传统自注意力,使单张GPU能在分钟级生成高质量视频。它在视频质量上优于DiT,减少FLOPs和延迟,与先进模型相当。

量子位
算法论文8

0人工参与实现梯度更!MIT框架让AI自动生成微调数据,权重自主升级

MIT提出强化学习框架SEAL,可让模型生成微调数据和自我更指令,实现权重更。无需人工,模型能自动梯度更。经知识注入和小样本学习实验验证效果,还介绍了其双循环工作机制

量子位
算法论文8

大模型是否对问题难度有预判?最研究揭示 LLM 内部的“难度感知机制

近期论文《Probing the Difficulty Perception Mechanism of Large Language Models》系统性解答大模型能否感知问题难度等问题。研究基于数据集在主流 LLM 上训练轻量线性探针,定位负责难度感知的注意力头,还发现不同模型表现有差异。

深度学习自然语言处理
开源动态8

AI4S设计的抗生素通过湿实验!双层思考+多目标优化,主动发现「代谢不稳」并加约束

SAGA是AI,采用双层思考机制,能主动审视需求、优化目标函数。在抗生素、纳米抗体等5大领域湿实验中表现出色,结果获科学家肯定,相关代码已开源。

量子位
算法论文8

字节跳动发布SeedFold,蛋白质结构预测相关多任务超越谷歌AlphaFold 3,揭示大模型缩放秘诀

字节跳动Seed团队推出一代折叠模型SeedFold,在多个蛋白质相关任务性能上超越谷歌AlphaFold 3。该研究为有效缩放生物分子基础模型提供思路,推出加宽模型、线性三角注意力等方法。

AI寒武纪
产品应用8

捅破具身智能天花板!极佳视界VLA大模型登场,复杂长时程任务近100%成功率

极佳视界推出GigaBrain-0.5M*VLA大模型,以世界模型条件驱动,引入人在回路持续学习机制。在与主流方法对比中,任务成功率提升30%,长时程任务近100%成功,还具备高效准确的价值预测能力。

量子位