智能体评估」共找到 3973 篇相关文章

算法论文8

ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能

阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能框架。它集成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。

PaperAgent
产品应用8

腾讯的这款AI数据智能工具Lumos,颠覆了传统的数据分析

文章聚焦腾讯AI数据智能工具Lumos,它是Tomoro的数据智能,采用多智能架构解决复杂问题。文中介绍其技术思路、实践方案,如解决多智能一致性、提升查询响应等,还提及后续优化方向。

腾讯技术工程
推荐文章7

A2A:多智能的协作总线

文章介绍了A2A协议,它是多智能系统的“协作总线”,能让不同智能安全高效协作。阐述其核心使命、与MCP区别、核心概念、工作流实例,还描绘了“智能社会”愿景,并给出基于官方文档的实现示例。

AIGC开放社区
算法论文8

智能新范式Chain-of-Agents,多项任务新SOTA

论文提出Chain-of-Agents (CoA) 范式,结合多智能系统与工具集成推理优势。通过多智能蒸馏和智能强化学习训练智能基础模型(AFM),实验显示其在Web和Code任务上达新SOTA,效率、泛化性佳。

深度学习自然语言处理
新闻资讯8

刚刚,Anthropic分享了他们在AI Agents评估的最佳实践

Anthropic发布blog《揭秘AI Agents评估》,指出良好评估能助团队信心发布AI智能,介绍评估结构、构建原因、评估方法、从零到一的路线图,还提到评估需与其他方法配合,全面了解智能性能。

PaperAgent
产品应用7

The Batch: 922 | 面向智能的管理系统

OpenAI 发布 Frontier 平台,用于编排和管理企业级 AI 智能团队。它支持智能构建、信息共享等,Cisco 等已试点,未来将更广泛开放。与 Microsoft 的 Agent 365 有不同侧重,企业对智能集中管理需求渐显。

DeeplearningAI
新闻资讯7

对话蚂蚁 AWorld 庄晨熠:Workflow 不是“伪智能”,而是 Agent 的里程碑

文章围绕AI Agent展开,蚂蚁集团AWorld算法负责人庄晨熠认为,当前AI陷入‘应试狂热’,Workflow是智能发展的里程碑,群智能与大模型相辅相成,还分享了智能应用实例及对未来的规划。

AI科技大本营
推荐文章7

评论送书 | Al智能与传统AI应用的区别?它如何工作?如何快速构建智能

文章对比AI智能与传统AI应用,指出前者更像“乐高积木”,可融入生活工作。介绍其工作是“感知—推理—执行—学习”循环,还给出快速构建通用方法,如明确目标、选框架等。

AIGC开放社区
开源动态8

Agent群智能来了!魔搭开源Agent自进化群智能框架:群记忆自动蒸馏与进化,8万+群技能即取即用,智能画像一键复用

个人或团队部署使用智能面临状态易失、重复试错、迁移困难等痛点。魔搭ModelScope团队开源的Ultron框架,补上群协作基础设施,解决经验沉淀、技能进化和画像共享问题,提升智能协作效率。

量子位
产品应用7

评论送书 | 我用扣子(Coze),五分钟搭建出一个客服自动应答智能

文章以设计‘产品功能咨询智能’为例,介绍用扣子平台搭建客服自动应答智能的全过程,包括创建项目、工作流、搭建流程框架及试运行优化,还推荐了相关书籍。

AIGC开放社区