「超长上下文」共找到 675 篇相关文章
华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」
今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。
领先于Transformer!新架构首个1200万上下文模型SubQ,成本仅Opus的5%
Subquadratic公司提出SubQ模型,核心是SSA亚二次稀疏注意力机制。该机制改变注意力计算分配,让模型真正读长文档。SubQ是首个有1200万token上下文窗口的前沿模型,成本低、速度快,有望革新大模型扩展路径。
从少样本到千样本!MachineLearningLM给大模型上下文学习装上「机器学习引擎」
新研究 MachineLearningLM 提出轻量可移植「继续预训练」框架,突破 LLM 在上下文学习局限,能学上千示例,在多领域分类任务超基准模型。它有三项核心创新,效果惊艳且应用潜力大,还指明未来研究方向。
EMNLP 2025 | CARE:无需外部工具,让大模型原生检索增强推理实现上下文高保真
MetaGPT等机构团队发布CARE框架,可让LLM将推理上下文与自身检索能力结合,已全面开源。它提出原生检索增强推理范式,采用两阶段训练策略,在问答基准实验中表现出色,为解决模型问题提供新路径。
Cursor 1.3 ~ 1.6 版本更新全梳理:终端不再挂、Agent 更聪明、上下文更可控
Cursor 1.3 - 1.6 版本有诸多更新。如自定义斜杠命令、改进 Agent 终端、升级 Agent 能力、增加左侧边栏管理等,还在上下文控制、工作流保护、MCP 资源支持等方面有优化。
MiniMax重磅开源M1模型:百万上下文超DeepSeek R1,实现性能与效率双杀
MiniMax正式开源首个推理模型M1,原生支持百万级上下文长度,在推理效率、计算成本和复杂任务能力上有独特表现。其在性能和效率上超越DeepSeek R1等模型,还提出创新强化学习算法。
把RoPE扔掉,AI更能看懂长上下文!Transformer作者团队开源大模型预训练新方法
Transformer架构核心作者之一Llion Jones团队开源新技术DroPE,可丢弃位置嵌入扩展上下文,解决RoPE长序列处理缺陷,在多模型实验中表现卓越。该团队来自Sakana AI,此前还有相关研究成果。
谷歌太壕了!编程Agent大招至简:开源且免费,百万上下文、多模态、MCP全支持
谷歌开源免费的编程Agent Gemini CLI,提供业界最高免费限额,能在终端访问Gemini。其能力多样,涵盖代码理解等,支持百万上下文、多模态和MCP,开源协议为Apache 2.0,还给出安装和使用指引。
Claude Sonnet 4 上下文翻 5 倍!100 万 token 能处理更大型代码库,AI 代码分析起飞。
Claude Sonnet 4 加入‘百万 token 俱乐部’,上下文容量翻 5 倍达 100 万,能处理大型代码库。不过功能在 Beta 有使用门槛和限制,价格也有变化,还对比了市场上其他模型。