几何上下文注意力」共找到 899 篇相关文章

开源动态8

不用额外缓存!英伟达开源大模型记忆压缩方案,128K上下文提速2.7倍

英伟达联合多机构推出TTT - E2E方法,在长文本处理上提速显著且性能不打折。它基于标准Transformer,将长文本建模转为「持续学习」任务,核心是上下文压缩,避免额外缓存,代码和论文已开源。

量子位
产品应用7

爆删80%系统提示词!Anthropic核心成员揭秘Claude 5最新玩法:上下文工程全面大换血

Anthropic针对Claude Opus 5、Claude Fable 5等新模型,删超80%Claude Code系统提示词,编码测试成绩无明显下降。CC技术团队成员发文指上下文工程规则重写,还总结新旧规则对比,并给出内容撰写建议,还上线新命令。

AI寒武纪
产品应用8

Claude Code 省 Token 指南:慎用 1M 上下文,不开新会话或者总是开新会话都不对

文章聚焦Claude Code省Token问题,分析配额消耗快的原因,介绍提示缓存机制,给出省钱策略、操作规则,还提及委派工作及澄清误解,强调让缓存多命中、上下文少装无关内容。

宝玉AI
新闻资讯7

Anthropic 技术栈里的「五宗罪」由何而来?

Anthropic的Claude模型升级后,用户却觉得不好用。X上帖子指出其存在文本和代码标记、模型能力、定价、长上下文等问题,这些问题卡在生成、计算、上下文和Agent运行时的5个具体位置,导致各方面互相拖后腿。

AI科技评论
开源动态8

代码检索新王登基!CodeFuse | 开源C2LLM,用“注意力池化”刷新MTEB-Code榜单

蚂蚁集团与上海交通大学推出C2LLM系列模型,基于注意力创新池化机制解决代码表征痛点,登顶MTEB - Code榜单。作为CodeFuse Embedding开源家族成员,将全套回馈社区,为代码大模型研发提供基线。

AINLPer
算法论文7

从deepseek v4的受限流线型超链接mHC谈架构优化

文章围绕DeepSeek v4的受限流线型超链接mHC探讨架构优化。指出过去十年深度学习重扩展层内计算,忽视层间通信。介绍多种层间通信改进方法,提出用检索替代累加,还提及深度注意力机制及混合深度注意力的成果。

Agent的潜意识
产品应用8

陶哲轩DeepMind梦幻联动,最强通用科学Agent来了!一口气解决芯片设计、矩阵乘法和300年几何难题

谷歌DeepMind与陶哲轩等打造的AlphaEvolve是LLM驱动的进化编码Agent。它能优化计算生态、调度数据中心等,还解决了数学难题,已在谷歌内部使用,现开启早期邀测试用。

量子位
算法论文8

JFM | 浙江大学郑畅东、谢芳芳等:基于Transformer网络的上下文学习跨翼型的主动流动控制策略

浙江大学郑畅东、谢芳芳等提出基于Transformer网络的上下文学习跨翼型主动流动控制策略。该框架引入策略改进算子,结合强化学习与气动形状优化,在翼型流动分离问题中表现出色,提升了整体性能。

力学与人工智能
算法论文8

单应计算加速数十倍、计算量减少95%!基于几何的SKS和ACA矩阵分解被提出

东华大学、上海交大和中科院自动化所团队提出基于几何的SKS和ACA单应矩阵分解,计算量比通用方法减超95%,能减少二维码扫描等应用的计算消耗,有望用于多领域,论文已被IEEE T - PAMI接收。

机器之心
新闻资讯8

字节 AI 卷出新高度:豆包试水“上下文定价”,Trae 覆盖内部80%工程师,战略瞄定三主线

近日字节分享 AI 技术发展三主线,6 月 11 日火山引擎有系列发布更新。豆包 1.6 实行上下文定价,成本降低;超 80% 字节工程师用 Trae;视频生成模型 Seedance 1.0 Pro 具性价比;智能体带动强化学习算力攀升。

AI前线