长上下文建模」共找到 1389 篇相关文章

新闻资讯7

不靠高薪靠信仰!以文化破局,Anthropic凭「使命驱动」杀出AI人才血路

顶尖AI人才争夺战在科技巨头间白热化,Meta等不惜高薪抢夺。但Claude开发商Anthropic工程师净增率超对手,它不靠高薪,凭“使命驱动”和独特文化吸引人才,其经验值得国内AI初创企业学习。

新智元
算法论文8

AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%

大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。

量子位
算法论文8

ICML 2025 | 西湖大学吴泰霖研究员团队:组合生成式多物理场多元件PDE仿真

西湖大学吴泰霖课题组联合多方提出“组合生成式多物理场多元件PDE仿真(M2PDE)”,将仿真问题视为生成式概率建模任务。该成果在多任务测试中表现卓越,被ICML 2025接收。

力学与人工智能
算法论文8

超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26

大语言模型处理文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。

新智元
产品应用8

Granola 为什么能赢:会议笔记,把产品做简单很重要

Granola是新推出一年多的AI笔记产品,迅速成硅谷创业者、投资人常用工具。其创始人认为,“AI笔记”头号竞争对手是苹果备忘录。产品好用关键在于极简“蜥蜴脑设计”与利用用户“上下文”,文中还分享设计思考与实用经验。

Founder Park
算法论文8

大模型再爆弱点!旧记忆忘不掉,新记忆分不出,准确率暴降 | ICML'25

弗吉尼亚大学和纽约大学研究人员用「前摄干扰」概念设计测验PI - LLM,测试大语言模型(LLM)上下文检索能力。结果显示,随干扰增加,模型准确率对数下降至零,提示工程效果有限,需调整模型架构或训练范式。

新智元
算法论文8

The Batch:841 | 大语言模型正在纠正历史遗留的不公

美国北加州旧不动产契约含种族歧视条款,虽已非法但人工筛查耗时久。斯坦福和普林斯顿研究团队微调大语言模型识别圣克拉拉县契约中的歧视条款,模型可理解上下文,结果经律师确认,研究成果已开源。

DeeplearningAI
推荐文章7

智能体工程的隐形技术债:10分钟造出一个 Agent,公司却要为它养一个平台团队

如今构建智能体容易,但投入生产后会面临诸多问题。文章围绕智能体绘制出集成、上下文湖等七个基础设施模块,分析各模块隐性技术债务,并指出不同阶段债务表现,还提及应对措施及相关会议推荐。

AI前线
算法论文8

突破万次连续编辑极限!中科院提出首个理论保稳的知识保留方法

中科院信工所研究人员提出LyapLock,将连续编辑建模为受约束随机规划问题,整合排队论和李雅普诺夫优化。实验显示,它能突破万次连续编辑极限,编辑效果比主流方法提升11.89%,还可赋能现有模型。

新智元
算法论文7

Megatron 1F1B流水线并行中的负载不均衡问题研究

文章分析Megatron 1F1B流水线并行中负载不均衡问题。通过实验发现通信时间‘一短一’,原因是最后一个Stage计算慢致不同步,额外计算引发通信延迟,还梳理了流水线各阶段执行过程。

GiantPandaLLM