智能体评估」共找到 3972 篇相关文章

算法论文8

ACL'25 | 多智能叛变进行中?首个多智能安全守卫G-Safeguard亮相!

随着基于LLM的多智能系统崛起,其安全隐患凸显。中国科学技术大学等机构提出G - Safeguard安全防护框架,它基于图神经网络,通过构建多智能话语图等方式,能有效抑制恶意信息传播,有强大防御和泛化能力。

PaperAgent
推荐文章8

11月必读!谷歌最新智能白皮书(2025年11月),免费下载,52页pdf

Google团队发布《智能简介(2025年11月版)》白皮书,可免费下载。它为开发者构筑智能架构绘蓝图,剖析智能三大支柱,提出分级系,阐述开发者角色变革,理念与架构如航海图。

AI寒武纪
开源动态7

三重Reward驱动的运维智能进化:多智能、上下文工程与强化学习的融合实践

文章阐述了AI原生时代下,面向技术风险领域的智能系统(DeRisk)的架构设计、核心理念等。介绍运维智能发展现状,提出其技术演进需找三类Reward,还介绍相关概念、DeRisk架构,给出实践案例并将开源技术产品。

阿里云开发者
算法论文8

ACL 2025 | 大模型乱试错、盲调用?KnowSelf让智能有「知识边界感知」能力

ACL 2025 论文《Agentic Knowledgeable Self-awareness》聚焦提升智能「知识边界感知」能力。KnowSelf 方法让智能自主调节知识运用,实验显示其性能优,还探索了智能自我认知多方面影响。

机器之心
新闻资讯7

AI也能换岗了!Anthropic教智能交接班,不怕长任务断片

Anthropic设计出长时智能运行框架,让AI跨越数小时任务渐进式推进。其采用双智能架构,结合环境管理方法,提升全栈Web应用开发稳定性,但仍有通用与多智能架构选择等开放问题。

新智元
算法论文7

基于大模型的领域场景开发:从单智能到多智能的React框架设计与实现

作者团队经历从提示词工程到流程编排模式各阶段,现设计架构升级,选用层级指挥模式的React框架,实现单智能对工具调用的反思规划,后续还将迭代实现多智能协作,同时提及技术选型、系统架构等内容。

阿里云开发者
算法论文8

谷歌发布智能Scaling Law:180组实验打破传统炼金术

谷歌新论文通过180组实验找到智能的Scaling Law(定量扩展原则),在四个基准测试评估,推导预测模型,实验结果颠覆直觉,还量化阻碍因素,发现不同模型协作性格,为智能部署决策提供支撑。

机器之心
开源动态8

登顶Hugging Face GAIA全球榜首!中兴超级智能终结「AI黑盒」时代

中兴通讯研发的超级智能Co - Sight 2.0登顶Hugging Face GAIA全球权威榜单。它解决传统智能痛点,有全链路可信计算框架等创新架构,其智能工厂和开放标准助力构建生态,展现了智能产业落地潜力。

新智元
算法论文8

当AI穿上白大褂:医疗智能正在重构临床工作流

新加坡等多所高校联合发表医疗智能综述研究。医疗智能有感知 - 认知 - 行动闭环,能深入临床长链条工作流。综述剖析其架构、协同机制、应用场景与安全挑战,还探讨评估及发展方向。

AIGC开放社区
开源动态7

Stripe 发布基准测试:AI 智能可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能短板在校验逻辑等方面。

InfoQ