「迭代循环优化」共找到 1720 篇相关文章
ICLR-26腾讯混元:Agent是强大的,但用户是狂野的
现有LLM工具使用基准测试场景理想化,忽视真实用户行为复杂性。腾讯提出WildToolBench,基于真实用户行为构建测试集,对58个模型评估,发现模型准确率低,揭示LLM在真实场景下能力缺口,为模型优化指明方向。
32B逆袭GPT-5.2:首个端到端GPU编程智能体框架StitchCUDA问世
现有LLM自动化CUDA方法难处理端到端GPU程序,StitchCUDA提出多智能体框架+基于Rubric Reward的Agentic RL方案,分解任务、优化训练,在实验中成功率和加速比远超其他方法,解决Reward Hacking问题。
ICLR 2026|人大&通义:别再只会堆上下文了!IterResearch用40K上下文轻松实现2048轮交互不退化
中国人民大学与阿里巴巴通义实验室团队提出 IterResearch 迭代式深度研究范式。它能让 Agent 在 40K 上下文下完成 2048 次工具交互且性能不衰减,解决了传统范式上下文臃肿问题,论文已被 ICLR 2026 接收。
Vibe Coding 在代码生成与协作中的实践与思考
本文整理自阿里专家向邦宇的分享。探讨构建 Vibe Coding 工具,介绍其分类、在阿里现状。指出用户使用中面临代码质量等问题,产品自身有设计、安全挑战。还分享 Agent 建设经验,强调适配国产模型及模板化的作用。
教科书《性能之巅》作者入职OpenAI!迷弟总裁亲自欢迎
系统性能优化领域顶级专家Brendan Gregg加入OpenAI,将参与ChatGPT性能团队。他被尊为“性能之神”,著有《性能之巅》等,发明火焰图。他自述因OpenAI环境与AI需求加入,还为圆童年科幻梦。
RoboChallenge发布年度报告:评测标尺够权威吗?
当下具身智能行业存在缺乏真实场景验证、评测标准模糊等问题。2025年原力灵机与Hugging Face推出RoboChallenge评测平台,2026年1月更新榜单。AI科技评论从技术和核心设计角度对其进行深度拆解。
AI Agent 记忆系统:从短期到长期的技术架构与实践
随着 AI Agent 应用发展,记忆系统成为构建实用 AI Agent 系统的关键技术。文章介绍了记忆基础概念、Agent 框架集成记忆系统的架构,阐述了短期记忆的上下文工程策略和长期记忆技术架构及集成,还分析了行业趋势与产品对比。
Skills的最正确用法,是将整个Github压缩成你自己的超级技能库。
文章指出重复造轮子不可取,Skills可将Github开源项目封装成技能库。以FFmpeg、yt - dlp等为例,介绍封装流程,还提及多场景应用,如视频下载、格式转换等,让普通人能利用开源成果。
语言模型内部还藏着众多策略模型?自底向上强化学习重塑底层特征 | 直播预约
现有强化学习工作将语言模型作整体策略优化,研究提出以策略视角审视内部隐藏状态,分析层级和模块级策略,发现不同模型模式差异,还提出自底向上强化学习策略,为研究架起新桥梁。
刚刚,Cursor又分享了数百Agent并发协作的最佳实践
Cursor分享数百Agent并发协作最佳实践,讲述单个Agent局限,介绍从多方面探索协同方法,如规划者与执行者分工,还展示多个实验成果,总结模型选择等经验,指出多智能体协同仍待优化。