几何上下文注意力」共找到 899 篇相关文章

算法论文8

CMAME | 香港理工大学周原野、周恺等:面向清晰几何边界工程优化的拉格朗日拓扑物理信息神经网络

近年来物理信息神经网络引入拓扑优化领域,但结果边界弥散。本文提出“拉格朗日拓扑物理信息神经网络”框架,将显式可变形基础几何体嵌入可微分物理求解器,提升了优化结果的可制造性与精度。

力学与人工智能
新闻资讯7

Andrej Karpathy:“ChatGPT套壳”的说法大错特错,提示词工程已过气

Andrej Karpathy力挺用“上下文工程”取代“提示词工程”,指出“提示词”过于简单,“上下文工程”更能揭示构建强大AI应用的本质。他强调“上下文工程”仅是构建大模型应用的一环,“ChatGPT套壳”说法大错特错。

AI寒武纪
推荐文章7

看完 Manus、Cursor 分享后的最大收获:避免 Context 的过度工程化才是关键

上下文工程优化是Agent创业公司新一年竞争重点,其信息质量很大程度决定Agent表现。文章结合Manus、Cursor团队思路,给出做好上下文工程要点,如缩减上下文、搭建工具行动空间、多Agent协作等。

Founder Park
开源动态8

为训推加速!全新FlashQLA注意力算子库开源

自Qwen3-Next发布,GDN成Qwen主力注意力层,随模型规模扩大开销增大。现开源FlashQLA算子库,融合优化GDN Chunked Prefill前反向算子,在NVIDIA Hopper上多场景加速,提升预训练和端侧推理效率。

千问大模型
开源动态8

Transformer创新架构SALA:上下文更长,推理更快

面壁智能发布行业首个大规模训练的稀疏 - 线性注意力混合架构 SALA 及文本模型 MiniCPM - SALA。该架构降低推理开销与显存占用,MiniCPM - SALA 在长文本处理及推理上表现出色,还发起大奖赛探索性能极限。

PaperAgent
算法论文7

姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”

姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型多依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。

量子位
算法论文8

数据蒸馏的双重突破:从几何保真到对抗鲁棒

深度学习中,数据集蒸馏可用精简合成样本替代庞大训练集且不牺牲模型性能,但面临精度和可靠性两大难题。两篇发表于 ICCV 2025 和 AAAI 2025 的论文分别给出解决方案,且代码已开源。

深度学习自然语言处理
产品应用8

DeepSeek-V4发布!高效百万上下文智能普惠时代来了

DeepSeek-V4发布,是开源社区关键分水岭。它解决超长文本处理效率痛点,架构与优化有多项突破,降低算力消耗和成本,适配国产芯片,性能比肩顶级闭源模型,推动开源社区两大未来趋势。

AIGC开放社区
推荐文章7

Anthropic说:Session Management 是最好用的 Harness Engineering!

Anthropic指出管理Session、Context等在Claude Code上已落地。模型上下文并非越长越好,rewind比纠错好,compact要把握时机,subagent可隔离上下文,如今行业看重agent产品runtime。

探索AGI
算法论文8

TACO: 让 CLI Agent 在自主迭代中学会丢掉无用上下文

由多校及研究团队联合提出 TACO,这是无需训练、即插即用的终端智能体自进化观测压缩框架。它能让智能体学习压缩规则,过滤低价值输出,保留关键线索,实验显示其提升了任务成功率和 token 效率。

机器之心