「上下文强化学习」共找到 2074 篇相关文章
跟上 AI 的节奏:为演进式架构构建上下文存储库
本文探讨AI辅助开发带来的上下文认知断层问题。在开发中,AI前期提效但后期难题凸显,企业面临团队执行和管理层决策层面隐患。可通过融合三大工程规范构建上下文存储库解决,确保开发逻辑可控。
机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习
端到端策略模型在物理世界失灵,现有在线学习路径未走通。清华 AIR 与域变换联合推出 Zetta ζ,通过三个闭环实现闭环物理智能体在线学习,实验显示其任务成功率高,还让机器人出现‘Aha Moment’。
以星为舵:LLM的Post-Train与Rest-Time奖励学习综述
这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。
谷歌新架构突破Transformer超长上下文瓶颈!Hinton灵魂拷问:后悔Open吗?
谷歌在NeurIPS 2025发布两项大模型新架构研究,通过‘测试时训练’机制,推理阶段可将上下文窗口扩展至200万token。新成果Titans和MIRAS结合RNN速度与Transformer性能,突破超长上下文瓶颈。
Claude Sonnet 4 API 支持百万上下文:解锁真正的生产级AI工程
Anthropic宣布Claude Sonnet 4支持100万Token上下文窗口,容量是之前5倍。长上下文支持已向部分客户公测,将推给更多用户。该功能已在亚马逊Bedrock公测,也将登陆Google Cloud。还介绍了用例、定价及早期用户好评。
ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键
ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。
ChatGPT「学习模式」火爆上线,一大波教育AI连夜被端!24小时导师免费用
OpenAI为ChatGPT上线苏格拉底「学习模式」,针对大学生,以交互式提示、分步解答等功能引导学习,可应对复杂学科难题。一经推出便受网友热捧,有人预言将端掉一波教育类AI。
“毋在浮沙筑高台”:汪源谈智能体想从 80 分跨到 90 分,全卡在上下文
前网易副总裁汪源在2026奇点智能产品大会分享,指出智能体系统瓶颈正从模型能力、Harness工程,转移到上下文。他还介绍了做好上下文基础设施的要点,以及推出的新内容格式KRL。
Codex正式开放1M上下文!解除GPT-5.6 Sol封印,三行配置搞定
现在3行配置就能让GPT - 5.6 Sol封印解除,在Codex里用上1M上下文。不过有网友警告轻易别用,因超出默认窗口,模型消耗token速度会翻倍,且模型上下文利用能力会下降。此外,Codex确定会上Astra。
狂揽16.1k星!清华开源交互式AI课堂,学霸打造的最懂学习的AI工具
清华开源的OpenMAIC是多智能体互动课堂平台,能将文档转化为互动学习场景,自动生成课件等内容,有五种交互式界面、AI教师指导,可在任何设备使用,对教育场景很有价值。