智能体评估」共找到 3972 篇相关文章

开源动态8

Agent RL和智能自我进化的关键一步: TaskCraft实现复杂智能任务的自动生成

当前智能训练缺高质量任务数据,主流数据集依赖人工标注,规模和复杂性受限。OPPO 研究院提出 TaskCraft 框架,能自动生成智能任务,构建并开源含约 41,000 条任务的数据集,支撑智能训练评估

机器之心
产品应用8

AI4S智能「井喷」,这个智能登顶多项评测榜单,实现产业落地

2026年是AI4S「智能元年」,科研智能产品密集发布,行业关注转向产品落地。深度原理发布的AI科学家平台Mira在多项评测中领先,其全链路闭环系统补齐传统短板,已在多领域落地验证。

机器之心
算法论文8

从物竞天择到智能进化,首篇自进化智能综述的ASI之路

普林斯顿大学等机构研究者发布首个自进化智能综述,为领域建统一理论框架和路线图。综述给出形式化定义,围绕What、When、How、Where构建分析设计框架,还探讨评估范式并指明未来方向。

机器之心
新闻资讯7

金融智能真的是大模型落地“最后一公里”?

InfoQ《极客有约》X AICon 直播栏目邀请业内人士探讨金融 AI 大模型实践现状。指出大小模型融合是主要方案,智能有应用但也有问题。还分享了评估 AI 项目的要点、智能应用案例及未来布局方向。

InfoQ
算法论文7

广义智能理论:智能时代通向「万物理论」的新路径?

源自AI的「广义智能理论」为探索「万物理论」提供新视角。它将物理、生命、AI系统纳入标准智能框架,提出四大基本作用力或源于「智能场」,还为经典、相对、量子力学差异提供新诠释。

新智元
开源动态8

模型即智能,Kimi K2 Thinking多项评估超越顶尖闭源模型,300轮工具调用不疲倦

月之暗面发布Kimi K2 Thinking,它是Kimi迄今最强开源思考模型,基于模型即智能理念训练,可自主连续工具调用与多轮思考,多项评估超顶尖闭源模型,还实现原生INT4量化,提升生成速度。

AIGC开放社区
产品应用8

用DAA衡量智能 百度智能云用“新全栈”重新定义AI云|甲子光年

2026年产业焦点转向智能落地,李彦宏提出DAA概念。百度智能云升级为新全栈AI云,解决智能落地难题,从架构决策、行业应用等多方面发力,其价值值得市场重估。

甲子光年
推荐文章8

企业级 Agent 多智能架构与选型指南 -- 来自1000+行业应用实践积累

本文基于超1000+智能应用实践经验,介绍企业级Agent多智能架构。强调单智能优先,介绍AgentScope支持的多智能模式,对比工作流与对话模式,给出架构选型指南,还提及Spring AI Alibaba Graph为多智能提供的能力。

阿里云开发者
推荐文章8

吴恩达来信:建立为人类服务的智能社群

吴恩达讨论编程智能分享经验平台的可能性,介绍了解决编程智能获取最新API文档问题的chub工具。他提出收集智能反馈以更新文档,还受Moltbook和Stack Overflow启发,认为智能贡献反馈很有价值。

DeeplearningAI
推荐文章8

Claude团队大揭秘!如何调动多智能搞深度搜索

Claude团队分享用多智能构建深度搜索的心得,展示有效多智能研究系统架构,涵盖系统架构、提示工程、评估方法等内容,还提及系统面临的问题、挑战及额外建议。

量子位