闪电注意力」共找到 227 篇相关文章

算法论文8

CoT推理大溃败?哈佛华人揭秘:LLM一思考,立刻就「失智」

新研究揭示思维链CoT会分散模型「注意力」,使大模型推理时易出错。研究指出在需遵守指令任务中,用CoT推理模型准确率下降,还总结了四大模式,并提出四种缓解策略。

新智元
新闻资讯8

击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军

在具身灵巧操作奥林匹克赛事Benjie’s Olympics中,中国具身智能公司星动纪元斩获三项全球第一,超越美国明星公司PI。其自研VLA具身模型优势显著,且已在多领域落地应用。

量子位
产品应用8

国产AI营销工具来了!工作流被Agent重构,营销物料一键即出

2026年营销与以往不同,传统营销困境重重,消费者注意力碎片化。巨量引擎推出「品星云AI营销新模式」,贯穿营销全链,有独家生态、硬核技术、体系协同优势,为AI营销产业级落地提供范本。

新智元
开源动态8

FlashAttention-4正式发布:算法流水线大改,矩阵乘法级速度

深度学习领域底层优化技术FlashAttention更新至4版本。其核心作者称在Blackwell GPU上,注意力机制执行速度接近矩阵乘法。新算法克服瓶颈,在B200上性能提升,还获Pytorch官方支持。

机器之心
算法论文8

清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026

大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。

AI科技评论
算法论文8

阿里新研究:统一了VLA和世界模型

阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。

量子位
开源动态8

Qwen3.8-Flash-Next:SGLang Day-0 支持

2026年8月26日,Qwen团队开源多模态MoE模型Qwen3.8 - Flash - Next,它是Qwen4架构早期预览版。SGLang在发布首日就提供完整支持,模型架构多方面升级,亮点众多,还给出启动命令及配置建议参考。

GiantPandaLLM
新闻资讯7

观猹 × MuSH | AI 练摊市集招募中,你的 AI 能让路人玩上 5 分钟吗?

5月15日上海举办MuShanghai AI Week,五天有不同主题活动。收官日有首个中外开发者齐聚的Demo练摊市集,强调产品好玩,设投票机制和奖项,还分闪电秀PK赛与开放麦环节。

特工宇宙
算法论文8

突破一亿Token极限:EverMind提出MSA架构,实现大模型高效端到端长时记忆

机器之心发布文章介绍,大模型长期记忆能力受限于上下文长度。《MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens》提出MSA架构,突破扩展性、精度和效率的不可能三角,实现100M长度的大模型长时记忆框架。

机器之心
算法论文8

大象秒变挖掘机!三维变形新突破,无需额外训练 | CVPR'26

南京大学与北京大学提出MorphAny3D,无需额外训练即可让三维生成模型实现跨类别平滑变形。它通过创新注意力机制融合源与目标特征,精准控制结构与时序,效果远超传统方法,代码已开源。

新智元