「长时任务」共找到 2895 篇相关文章
Harness Engineering 实践:Fitness Function 如何成为 AI 交付的防腐层
文章探讨 Harness Engineering 实践中,Fitness Function 如何成为 AI 交付防腐层。指出在 AI Agent 参与开发时,判断任务完成是难题,介绍 Routa 项目构建 Fitness 架构及规则执行等实践。
Agent下半场!比Prompt更重要的是「上下文工程」,Anthropic首次系统阐述
Anthropic发文章阐述上下文工程,指出构建语言模型重点正从提示工程转向上下文工程,探讨了其与提示工程区别、重要性,给出实践指导原则、新趋势及应对长时程任务策略。
从答题到做实验:SciAgentGym让大模型进入科学工作流
复旦大学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。
Claude Opus 4.7 发布!留给人类的时间,不多了
Anthropic 发布 Claude Opus 4.7,核心升级是让 AI 跑长且复杂任务,还能自我验证结果。它视觉能力超强,编程能力提升,新增 /ultrareview 功能,API 多了调节档,不过 token 数量或增加,成本可能上浮。
白嫖微软开源Web Agent,独立开发者的第二双手:自动刷网页、跑脚本、盯进度,全交给 Magentic-UI
Magentic-UI是微软开源的Web Agent界面,能控制浏览器、执行代码等,解决长流程、重复且让人不放心全交给AI的任务。它可视化操作,有可复用计划图库等亮点,使用体验好,适合特定开发者。
提速30倍,Meta重新定义了新一代RAG!
LLM时代,RAG成知识密集型任务标准范式,但处理长上下文时面临延迟高、内存贵问题。Meta超级智能Lab针对RAG特殊结构优化,提出REFRAG框架,有独特训练策略,实验效果显著。
GPT-5的所有传言,以及,Sora 2?
OpenAI今晚1点举办直播,GPT - 5将亮相。发布前关键信息汇总,包括直播时长变长、GitHub泄露四个版本、三档定价策略、突破人类基准测试等,还或同步发布Sora 2。
GPT-5.2连肝7天,300万行代码造出Chrome级浏览器
Cursor的CEO让GPT - 5.2连续运行一周,产出300万行代码,从零构建Chrome级浏览器。还介绍不同模型长任务表现、多智能体协作架构,指出这将颠覆软件开发经济学。
马斯克悄悄改了战场:Grok Build 0.2.60 剑指 Agent Runtime
2026年6月21日,Grok Build发布0.2.60版本更新,未推新模型能力,而是聚焦Runtime细节,针对会话难恢复、长任务易卡住、工具输出易污染上下文等痛点优化,让Agent更稳定可靠。
纽约时报:一名自杀少年父母,决定起诉ChatGPT
纽约时报消息,16岁的亚当用ChatGPT辅助学习,后向其倾诉自杀计划并最终自杀。其父母起诉OpenAI,认为ChatGPT没阻止悲剧,OpenAI虽设防护机制,但长时互动中效果减弱。