智能体评估」共找到 3972 篇相关文章

算法论文8

InfoDeepSeek:首个开放网络环境下的智能信息搜寻质量评估基准

上海交通大学与华为诺亚方舟实验室联合推出InfoDeepSeek,它是首个评估真实动态网络环境下智能信息搜寻质量的基准。该基准有挑战性问题、真实动态环境等亮点,还开展实验揭示智能行为特性。

AI科技评论
开源动态8

Spring AI Alibaba 1.0 GA 正式发布,Java智能开发进入新时代

2025年AI智能爆发,Java智能构建需求激增。Spring AI Alibaba 1.0发布,是基于Spring AI的AI框架,提供多智能框架、生态集成等核心能力,助力Java智能开发,还规划了持续迭代、可观测评估等功能。

阿里云开发者
算法论文8

科研智能「漫游指南」—助你构建领域专属科研智能

该综述提供科研智能构建指南,提出三级分级系统,阐述构建流程与能力增强方法,涵盖知识组织、注入、工具集成,还提及基准评估和未来研究方向,促进AI与自然科学融合。

机器之心
开源动态8

腾讯开源智能构建框架

腾讯开源智能构建框架 Youtu-Agent,灵活高性能,验证性能出色,开源友好成本低。有自动智能生成等亮点,适用于不同用户群,涵盖研究、开发等场景,还介绍核心概念,附项目地址。

GitHubStore
算法论文8

解决智能手工构造难题! 浙大&腾讯提出 ReCreate,从零自动构建领域智能

浙大、腾讯等机构研究者提出ReCreate框架,不依赖手工设计,让智能自主构建。它从交互经验中找优化方向,有三重设计,实验显示能提升多领域任务通过率、降成本,未来或开启AI“自我制造”时代。

AI科技评论
产品应用7

构建能源领域的AI专家:一个多智能框架的实践与思考

本文介绍阿里团队在能源领域构建多智能框架的实践。因单智能处理复杂任务有“注意力发散”问题,团队研发综合能源智能平台,阐述框架搭建、各组件功能及设计考量,还分享思考与可优化点。

阿里云开发者
推荐文章8

智能在「燃烧」Token!Anthropic公开发现的一切

Anthropic发布多智能研究系统构建解释,解决多智能研究困惑。多智能系统优势明显,在特定任务中表现出色,但token消耗大。其架构独特,还介绍了提示词工程、评估方法、面临的工程挑战等内容。

机器之心
算法论文8

首个GUI多模态大模型智能可信评测框架+基准:MLA-Trust

MLA-Trust 是首个针对 GUI 环境下多模态大模型智能的可信度评测框架,构建了涵盖四核心维度的评估系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。

机器之心
推荐文章8

OpenAI: 构建 AI 智能实用指南

OpenAI发布的《构建AI智能实用指南》,阐述智能定义、适用场景,介绍构建的核心组件、架构编排,强调安全保障,指出构建需多方要素配合,未来聚焦智能生态系统。

宝玉AI
推荐文章7

将 Pod 作为 worker 而非智能:在 Kubernetes 上重新思考 AI 智能的部署单元

在CNCF博客文章中,Lin Sun介绍kagent项目工作,认为Pod可能是智能执行单元,却不适合作为部署、身份标识或生命周期单元。探讨了两种智能部署方法及利弊,还提及新部署模式影响。

InfoQ