「子任务级可验证性」共找到 2763 篇相关文章
单任务狂飙16小时!模型+Harness双轮驱动,金融Agent跑通了
2026年AI圈热词Harness成Agent产品基础设施。通用Harness难适配金融订单,易鑫首席科技官贾志峰将开源自研Harness Framework,采用三层驾驭体系,实测效果佳,成本低。
拆解腾讯智能体战略:自身验证,开放能力,生态放大 | 甲子光年
文章指出智能体成企业战略议题,但落地有场景复杂、知识专业和工程化挑战。腾讯云以全栈方案应对,用开发平台、行业适配和生态共建助力企业,多个行业已有成功落地案例。
WWW'26 | 跨任务自适应的Multi-Agent协作新范式
大型语言模型驱动的多智能体系统成解决复杂任务重要范式,但智能体协作存在关键问题。Griffith和西北农林科技大学团队提出OFA - MAS,将多智能体拓扑设计从one - for - one推向one - for - all,实验效果佳。
跨机器、物体与各种任务!RoboScience发布通用具身大模型
RoboScience机器科学发布Visics通用具身大模型并披露VLOA技术架构。该模型从底层搭建全新具身基础表征单元,适配任意机器人、物体和任务。其由具身世界模型和通用操作模型组成,有强大泛化和操作能力。
DeepAgent:能够自主找工具的深度思考智能体,工具&任务随心配
现有智能体框架自主性差、工具使用受限。中国人民大学等机构研究者提出DeepAgent,能自主思考、发现工具并执行动作。它在多基准测试中表现出色,为构建更强真实世界智能体迈进重要一步。
现在模型这么强还需要专业提示词吗?
文章探讨是否还需专业提示词,指出简单任务无需复杂提示词,但复杂任务时,它能像‘数学公式’拆解需求,还能充当‘工作流经理’。用好提示词能让AI成生产力工具。
Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜
Einsia AI旗下Navers lab发布Agent Benchmark——Frontier-Eng Bench,让AI在47个多学科交叉的硬核任务中做工程优化,测试其迭代优化能力。研究总结出AI进化规律,初步勾勒接近真实工程循环的AI系统。
AI也能换岗了!Anthropic教智能体交接班,不怕长任务断片
Anthropic设计出长时智能体运行框架,让AI跨越数小时任务渐进式推进。其采用双智能体架构,结合环境管理方法,提升全栈Web应用开发稳定性,但仍有通用与多智能体架构选择等开放问题。
倒反天罡:「租个人」网站爆火,AI开始雇人「跑腿」了
「rentahuman.ai」网站定位为「AI 的肉身层」,AI 可通过 MCP 协议或 REST API 雇人完成线下任务。网站上线后人力增长快,但也引发付款、任务真实性、安全伦理等疑问。
再不怕乱引文献!绕过付费墙,BibAgent把学术核验转为证据链
大模型生成学术论述,其引用验证成难题,尤其付费墙后论文难以核验。BIBAGENT突破此困境,不破解付费墙也能验证引文语义真伪,还构建MISCITEBENCH评测,表现优异,为科学写作补“可审计基础设施”。