几何上下文注意力」共找到 899 篇相关文章

算法论文8

ICML 2026 | 大模型为什么算不对加法?南大团队提出等本位和轨迹,揭示LLM算术错误的几何机制

南大团队研究LLM在多操作数加法中的内部表征结构,发现算术状态呈高度结构化几何流形。提出等本位和轨迹与噪声量化模型,解释模型算错加法原因,还设计推理时纠错方法。

机器之心
8

刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%

月之暗面推出全新注意力架构Kimi Linear,有望成下一代Agent LLM基石技术。它解决了LLMs处理长序列任务的瓶颈,性能超传统机制,还开源了核心代码。Kimi Linear的KDA模块提升了表达和硬件效率,实验表现佳。

AI寒武纪
开源动态8

刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界!

蚂蚁灵波开源的LingBot - Map模型实现无尽流,可看∞帧视频稳定实时3D重建。它打破“既要实时、又要记路、还要省显存”的不可能三角,在多项测试中表现优异,补齐具身智能关键拼图。

量子位
算法论文7

模型宣称的“百万字处理能力”是真本事,还是营销噱头?LongCodeBench揭露真相

近年来大模型号称有百万字处理能力,但这是真本事还是噱头存疑。论文用LongCodeBench测评工具揭开长上下文模型真实表现,测试顶尖模型发现长文本能力‘翻车’,还分析了长上下文难的原因及面临的瓶颈。

深度学习自然语言处理
算法论文8

首个实例理解3D重建模型!NTU&阶越提出基于实例解耦的3D重建模型,助理场景理解

人类能自然感知3D世界的几何与语义,但AI做到“两者兼得”是挑战。NTU联合StepFun提出IGGT,将空间重建与实例级上下文理解融为一体,还构建了InsScene - 15K数据集,解决了传统方法的问题。

量子位
开源动态8

读完这篇,你就搞懂 DeepSeek v4 了

2026年4月24日,DeepSeek全新系列模型DeepSeek - V4预览版上线并开源,评分接近‘闭源三巨头’。该模型强在1.6T参数+1M上下文,还有从attention到kernel的系统级重构与优化,在架构和工程层面均有创新。

腾讯技术工程
推荐文章7

Anthropic:怎么才能控制模型的行为,做好Agents?

Anthropic发关于AI Agents博客,围绕如何配置上下文让模型输出期望行为展开。指出上下文是有限资源,有Context Rot现象,介绍了上下文工程概念、构成,还提及即时策略、长时间任务处理方法及实践建议。

探索AGI
新闻资讯7

金山、Zilliz、腾讯、灵犀量子专家齐聚,揭秘 AI 记忆、RAG 演进与自我进化的工程实践 | AICon

2025 年构建复杂 AI 系统面临记忆缺失、检索瓶颈、认知固化等系统工程挑战,Context Engineering 是关键。AICon 北京站邀金山、Zilliz、腾讯、灵犀量子专家,分享上下文工程技术实践。

InfoQ
开源动态7

不想买几百刀的 ChatGPT Pulse?这款开源替代 + 本地部署可以白嫖试试

MineContext是开源跨平台桌面应用,可把电脑操作变成“上下文记忆库”。它能自动收集信息、生成总结和待办等。有自动截屏、生成总结等功能,使用体验好,适合常忘工作内容的信息工作者。

小华同学ai
算法论文8

Kimi新论文太硬核了!马斯克和Karpathy相继点赞~

马斯克和Karpathy点赞Kimi新论文《Attention Residuals》。该论文由杨植麟带队、苏剑林等参与,提出注意力残差(AttnRes),解决深层网络信息稀释问题,还通过工程折中降低成本,实验效果良好。

PaperAgent