智能体基准」共找到 4075 篇相关文章

产品应用8

将科研脏活累活真·丢给AI!上海AI Lab推出深度科研智能FlowSearch

上海人工智能实验室推出深度科研智能FlowSearch,它由动态结构化知识流驱动,有三大核心模块。在多个科研基准上性能领先,能让科研更高效,标志科研智能迈向新阶段,还为未来系统奠定基础。

量子位
算法论文8

手机AGI助手还有多远?移动智能复合长程任务测试基准与调度系统发布

上海交大与澜舟科技研究发现现有移动端GUI智能处理复合长程任务能力不足,提出UI - Nexus测试基准和Agent - NEXUS调度系统,经实验能提升任务完成率,也为AI原生操作系统建立雏形。

机器之心
开源动态8

Agent RL和智能自我进化的关键一步: TaskCraft实现复杂智能任务的自动生成

当前智能训练缺高质量任务数据,主流数据集依赖人工标注,规模和复杂性受限。OPPO 研究院提出 TaskCraft 框架,能自动生成智能任务,构建并开源含约 41,000 条任务的数据集,支撑智能训练评估。

机器之心
产品应用8

用DAA衡量智能 百度智能云用“新全栈”重新定义AI云|甲子光年

2026年产业焦点转向智能落地,李彦宏提出DAA概念。百度智能云升级为新全栈AI云,解决智能落地难题,从架构决策、行业应用等多方面发力,其价值值得市场重估。

甲子光年
推荐文章8

AI 智能实践评估:基准、框架与经验总结

文章为将 AI 智能从原型落地到生产环境的团队提供实用评估框架。指出传统评估不适用于智能,介绍评估工具,阐述五大评估支柱,还给出基于 Claude 和 LangChain 的评估示例及实践经验。

InfoQ
推荐文章8

企业级 Agent 多智能架构与选型指南 -- 来自1000+行业应用实践积累

本文基于超1000+智能应用实践经验,介绍企业级Agent多智能架构。强调单智能优先,介绍AgentScope支持的多智能模式,对比工作流与对话模式,给出架构选型指南,还提及Spring AI Alibaba Graph为多智能提供的能力。

阿里云开发者
新闻资讯7

谷歌发76页智能白皮书!你的「AI替身」已上线

谷歌发布76页AI智能白皮书,剖析其应用前景。涵盖智能运维、评估方法,探讨多智能架构,还介绍智能增强检索生成及企业应用,如NotebookLM企业版、Agentspace空间企业版等。

新智元
推荐文章8

吴恩达来信:建立为人类服务的智能社群

吴恩达讨论编程智能分享经验平台的可能性,介绍了解决编程智能获取最新API文档问题的chub工具。他提出收集智能反馈以更新文档,还受Moltbook和Stack Overflow启发,认为智能贡献反馈很有价值。

DeeplearningAI
算法论文8

InfoDeepSeek:首个开放网络环境下的智能信息搜寻质量评估基准

上海交通大学与华为诺亚方舟实验室联合推出InfoDeepSeek,它是首个评估真实动态网络环境下智能信息搜寻质量的基准。该基准有挑战性问题、真实动态环境等亮点,还开展实验揭示智能行为特性。

AI科技评论
算法论文8

刚刚,英伟达革了自己的命:智能自主进化7天,干掉所有算子工程师、GPU专家

英伟达新研究AVO构建了新型进化变异算子,用自主编码智能取代经典方法。智能7天自主进化,优化MHA内核,性能超cuDNN和FlashAttention - 4,还能快速适配GQA,展现强大泛化能力。

机器之心