长上下文建模」共找到 1387 篇相关文章

推荐文章7

跟上 AI 的节奏:为演进式架构构建上下文存储库

本文探讨AI辅助开发带来的上下文认知断层问题。在开发中,AI前期提效但后期难题凸显,企业面临团队执行和管理层决策层面隐患。可通过融合三大工程规范构建上下文存储库解决,确保开发逻辑可控。

InfoQ
开源动态8

英伟达&MIT等推出Long-RL,视频训练速度翻倍

英伟达联合MIT等推出Long - RL,它是面向序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。

机器之心
产品应用8

DeepSeek-V3.2-Exp:用稀疏注意力打破文本效率瓶颈

在NLP领域,处理文本时传统注意力机制效率低。DeepSeek团队推出DeepSeek-V3.2-Exp模型,引入稀疏注意力机制,在保持性能同时提高文本处理效率,降低计算复杂度,在多基准测试中表现良好。

CourseAI
算法论文8

AAAI 2026 Oral | 告别注意力与热传导!北大清华提出WaveFormer,首创波动方程建模视觉

北大清华团队在AAAI 2026 Oral论文中提出WaveFormer,首创用波动方程建模视觉。它将特征传播写成欠阻尼波动方程,实现频率 - 时间解耦,在多任务验证中速度、效率与精度全面超越。

机器之心
新闻资讯7

AI也能换岗了!Anthropic教智能体交接班,不怕任务断片

Anthropic设计出时智能体运行框架,让AI跨越数小时任务渐进式推进。其采用双智能体架构,结合环境管理方法,提升全栈Web应用开发稳定性,但仍有通用与多智能体架构选择等开放问题。

新智元
新闻资讯8

谷歌新架构突破Transformer超上下文瓶颈!Hinton灵魂拷问:后悔Open吗?

谷歌在NeurIPS 2025发布两项大模型新架构研究,通过‘测试时训练’机制,推理阶段可将上下文窗口扩展至200万token。新成果Titans和MIRAS结合RNN速度与Transformer性能,突破超上下文瓶颈。

量子位
新闻资讯8

DeepMind哈萨比斯:AI能建模所有进化而来的事物

谷歌DeepMind首席执行官哈萨比斯在与莱克斯的对谈中,深入探讨了人工智能的未来,包括其在模拟物理现象、视频游戏开发中的应用,以及通用人工智能的潜在发展。他认为任何能通过进化形成的事物都能被AI高效建模,还分享了对多个AI相关问题的看法。

量子位
新闻资讯7

电科技汽车电子公司投产,剑指车规与机器人芯片封测新高地!

3月10日,电科技汽车电子(上海)有限公司启用投产,这是临港新片区集成电路与智能汽车产业融合成果。该公司围绕车规核心应用构建制造能力,还兼顾机器人芯片封测,引入智能与AI技术提升效率。

芯师爷
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
新闻资讯8

“毋在浮沙筑高台”:汪源谈智能体想从 80 分跨到 90 分,全卡在上下文

前网易副总裁汪源在2026奇点智能产品大会分享,指出智能体系统瓶颈正从模型能力、Harness工程,转移到上下文。他还介绍了做好上下文基础设施的要点,以及推出的新内容格式KRL。

AI科技大本营