「混合注意力模型」共找到 7807 篇相关文章
不会拍照有招了!北大彭宇新团队开源首个美学指导大模型Venus,帮你拍好照|CVPR 2026
北大彭宇新教授团队针对现有大模型在摄影指导上的不足,定义美学指导任务,构建数据集AesGuide,提出美学指导大模型Venus。相关论文被CVPR 2026接收并已开源,Venus在多项评测中优于现有方法。
Mamba核心作者新作:取代DeepSeek在用的注意力机制,专为推理打造
Mamba核心作者Tri Dao团队提出GTA和GLA两种专为推理定制的注意力机制,在减少KV缓存用量、保持模型质量的同时,显著提升解码速度,优化长上下文推理能力。
中国科学SCPMA | 南科大王建春团队:基于改进隐式轴向分解Transformer的三维槽道湍流快速预测
南科大王建春团队改进IFactFormer模型,采用“并行”轴向分解注意力机制,提升在复杂流动问题中的表征能力和稳定性。实验显示,改进模型拟合与长期预测能力强,多数指标精度优于传统方法。
Kimi 大模型训推混部的稳定性与资源优化实战
月之暗面系统工程师黄维啸在 QCon 大会分享 Kimi 大模型训推混部实践。介绍了训推集群挑战,如故障多、资源利用低等,还阐述了全链路稳定性提升、资源高效利用及强化学习混合部署等方案。
中国团队引领太空算力:首次太空在轨部署通用大模型,发2800颗卫星服务数亿硅基智能体
岁末年初,全球AI竞争聚焦太空算力,中美你追我赶。美国Starcloud宣布在太空跑通大模型,中国国星宇航发布全球首个服务硅基智能体的太空算力网,计划用2800颗卫星服务数亿个硅基智能体,还实现通用大模型在轨部署。
突破具身智能任务规划边界,刷新具身大脑多榜单SOTA,中兴EmbodiedBrain模型让具身大脑学会「复杂规划」
当前主流大语言模型在具身任务场景面临瓶颈,中兴星云大脑团队推出具身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。
打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力
如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。
聊聊 Token 出海的生意经:模型开源给世界,中国赚什么?
本文围绕中国开源模型展开,介绍了 Cursor 使用 K2.5 模型事件,阐述了开源模型供应链,分析了中国开源模型受欢迎原因,探讨小公司技术机会,还提及开源面临的挑战及未来趋势,指出其正改变全球 AI 基础设施格局。
一年磨一剑,今年最炸机器人Demo来了!1亿美元种子轮团队出手,单个模型解锁单手打蛋解魔方弹钢琴
Genesis AI发布机器人基础模型GENE - 26.5,让机器人可自主完成烹饪、实验室操作等复杂任务。该团队全栈自研,从硬件、数据、模型到训练评估都有独特方案,曾获1.05亿美元种子轮。
刚刚,谷歌AI路线图曝光:竟要抛弃注意力机制?Transformer有致命缺陷!
谷歌未来AI路线图曝光,Gemini全模态是重点,模型向智能体转变,推理能力将扩展。谷歌还需突破现有注意力机制限制实现无限上下文。此外,文中盘点了OpenAI、DeepSeek等大厂AI年中表现。