「长程执行」共找到 571 篇相关文章
谁说Scaling Law到头了?新研究:每一步的微小提升会带来指数级增长
很多人质疑扩大计算规模训练模型的做法,因Scaling Law面临收益递减。但新研究发现,模型单步准确率的微小提升能使完成任务长度指数级增长,还探讨了长程执行能力的衡量及影响因素。
GPT-5.4 仅 11.36%!当大规模工具生态变成迷宫,LLM Agent 还能完成长程规划吗?
PlanBench-XL 来自 UIUC 团队,将 LLM Agent 放入零售 API 世界,评测其长程规划能力。它考虑真实工具环境挑战,含 327 个任务等,发现多数模型规划难、恢复差等问题,并给出改进启示。
人类或将沦为“NPC”!智谱创始人唐杰最新研判:LLM正从攻克长程任务到全自主进化
智谱创始人唐杰认为今年LLM技术突破点在长程任务,能在智能体环境交互完成复杂任务。随能力提升,将迈向‘无人公司’时代,人类或成‘NPC’。后续要攻克记忆、学习等技术,实现自我进化,重塑产业。
破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o
腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。
首款推理具身模型,谷歌DeepMind造!自主理解/规划/执行复杂任务,打破一机一训,还能互相0样本迁移技能
谷歌DeepMind发布新一代通用机器人基座模型Gemini Robotics 1.5系列,由GR 1.5和GR - ER 1.5组成,结合视觉、语言与动作,实现“规划 + 执行”闭环,还提出Motion Transfer机制,能跨机器人迁移技能。
Flash-Searcher:Web Agent的并行革命
当下Web智能体用顺序执行链解决复杂任务存在执行和信息利用率低的问题。为此提出Flash - Searcher,以DAG并行执行机制为核心,提升执行吞吐与速度,在多基准上表现优,代码已开源。
GPT5.5 + Codex 如何跑一整夜,编程的下一步,不是辅助编程,是可托管执行单元
文章指出GPT - 5.5在Codex里展现出强大自主性,能处理长时程任务。还介绍让其跑长任务的方法及面临的问题,强调长任务需状态机、证据链等,社区也在构建相关工作流层。
具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统
香港科技大学(广州)等多机构打造具身智能评测基准 RoboMemArena,突破传统局限,构建综合评测体系,配套真机测评。它提供多模态标注,任务长程多样,开源资源易用,PrediMem 在其上表现出色。
The Batch: 893 | 从预测到执行
2026 年 AI 研究应认识到能预测的模型不等同于能行动的系统。过去十年在被动预测和生成建模成就非凡,但现实任务需系统执行一系列动作。转向长周期任务和目标导向 AI 系统有两大好处。
长程任务飙升98%,斯坦福Skill原生LLM来了
普林斯顿、CMU、斯坦福、牛津等提出Skill-Native大模型,提出Skill Entropy度量技能切换难度,搭建Skill²-Bench评测,还将熵用作训练信号提出Skill-Entropy RL,提升多模型准确率,且技能熵可复用。