「稀疏注意力优化」共找到 1447 篇相关文章
刚刚,DeepSeek扔出大杀器,梁文锋署名!暴力优化AI架构
2026新年第一天,DeepSeek发表梁文锋署名新论文,提出「mHC(流形约束超连接)」架构。它仅增约6.7%训练时间开销,就能让27B参数模型性能显著提升,还可能淘汰ResNet结构。
为什么我坚决投入GEO(生成式引擎优化)?
AI改变流量分配规则,站长竞争焦点从‘排名位置’变为‘被引用率’,GEO应运而生。作者总结了GEO打法,如优化全站、关键页面,做结构化数据增强,还应用于自身产品。
规模化人工判断:Dropbox 如何借助大语言模型优化 RAG 系统标注
为提升 Dropbox Dash 生成回复的相关性,工程师采用大语言模型辅助人工标注。该方案解决了纯人工标注的局限,通过人工校准大语言模型标注的方法,为 RAG 系统提供了有价值参考。
博士学位答辩PPT分享 | 基于神经网络的偏微分方程优化求解方法研究
本文聚焦基于神经网络的偏微分方程优化求解方法,指出传统数值求解范式有局限,物理信息神经网络(PINNs)虽有潜力但面临瓶颈。作者从多方面研究,形成工程流动问题分析框架与改进方法。
挖掘注意力中的运动线索:无需训练,解锁4D场景重建能力
香港科技大学(广州)与地平线团队提出VGGT4D,通过分析VGGT内部机制,利用注意力层运动线索,提出无需训练框架,在动态物体分割等任务表现优异,为低成本4D重建提供新思路。
Kimi 大模型训推混部的稳定性与资源优化实战
月之暗面系统工程师黄维啸在 QCon 大会分享 Kimi 大模型训推混部实践。介绍了训推集群挑战,如故障多、资源利用低等,还阐述了全链路稳定性提升、资源高效利用及强化学习混合部署等方案。
刚刚,谷歌AI路线图曝光:竟要抛弃注意力机制?Transformer有致命缺陷!
谷歌未来AI路线图曝光,Gemini全模态是重点,模型向智能体转变,推理能力将扩展。谷歌还需突破现有注意力机制限制实现无限上下文。此外,文中盘点了OpenAI、DeepSeek等大厂AI年中表现。
字节Seed提出序贯策略优化方法,突破同传“质量-延迟”权衡问题
AI字幕质量和延迟难平衡是业界老问题。香港中文大学、字节跳动Seed和斯坦福大学研究团队提出序贯策略优化框架SeqPO - SiMT,在70亿参数规模实现SOTA,翻译质量媲美Qwen - 2.5 - 7B离线水平。
智能流体力学青年学者论坛第29讲:刘军博士——人工智能技术在工业产品设计中的应用
本报告重点介绍贝叶斯优化技术在工业气动设计产品设计上的应用,采用特定方法用于电动汽车暖通空调系统设计,以降低CFD成本。还简单介绍工业产品优化设计中另外两种成功方法。
别再手动百度了!让 AI 帮你“开挂”搜全网,效率 x10
随着DeepSearch问世,搜索模式正从传统网络搜索向智能体搜索转变。文章拆解Search Agent核心模块,围绕制定任务、搜索、优化、应用和评估分析,介绍各模块特点、架构及优化方向等。