智能体基准」共找到 4075 篇相关文章

新闻资讯7

什么都不做就能得分?智能体基准测试出现大问题

随着AI智能走向实际应用,其基准测试变得至关重要。但现有基准测试问题多,如WebArena判错答案、τ - bench给无操作智能高正确率。文章提出有效性判据和ABC清单,还揭示主流基准测试诸多问题。

机器之心
新闻资讯8

微软 Build 2025:AI 智能时代与开放智能网络的构建

微软 Build 2025 大会展示迈向 AI 智能时代路径,如发布新功能助力开发者,让 AI 智能更强大安全,支持开放智能网络,还推出平台加速科学发现。

AIGC开放社区
产品应用8

无问芯穹首曝智能服务平台,以基础设施加速企业级「智能自由」

12月16日,无问芯穹在智能生态论坛发布智能服务平台。该平台为企业提供全链路陪伴式落地服务,解决生产级智能落地和规模化的难题,助力企业实现智能的高效商业化落地与可持续运营。

机器之心
推荐文章8

IJCAI 研究卓越奖得主 Nick Jennings:一个智能的聪明,不如一群智能的相遇|IJCAI 2026

8月18日,IJCAI 2026大会上,研究卓越奖得主Nick Jennings回顾智能发展历程,指出当下智能AI火热,它并非新概念,而是经数十年积累。还分享经验,展望从智能智能社会的未来。

AI科技评论
算法论文8

AgentAuditor: 让智能安全评估器的精确度达到人类水平

LLM智能进化为“行动派”,但自主权带来安全问题。现有评估基准缺乏有效精准评估器,研究者推出AgentAuditor框架及ASSEBench基准,让LLM评估器精确度达人类水平,为构建可靠智能提供工具。

机器之心
开源动态7

Stripe 发布基准测试:AI 智能可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能短板在校验逻辑等方面。

InfoQ
算法论文8

上海交大团队发布首篇「搜索智能」综述!四个维度深度剖析搜索智能

上海交大团队发布首篇「搜索智能」综述,从如何搜索、优化、应用、评估四个维度剖析。随着LLM兴起,搜索从传统模式向搜索智能转变,虽有潜力但缺统一研究视角与评估框架,该综述提供了路线图。

AI科技评论
产品应用8

AI4S智能「井喷」,这个智能登顶多项评测榜单,实现产业落地

2026年是AI4S「智能元年」,科研智能产品密集发布,行业关注转向产品落地。深度原理发布的AI科学家平台Mira在多项评测中领先,其全链路闭环系统补齐传统短板,已在多领域落地验证。

机器之心
算法论文7

广义智能理论:智能时代通向「万物理论」的新路径?

源自AI的「广义智能理论」为探索「万物理论」提供新视角。它将物理、生命、AI系统纳入标准智能框架,提出四大基本作用力或源于「智能场」,还为经典、相对、量子力学差异提供新诠释。

新智元
算法论文8

迈向原生全模态AI智能:人大&小红书发布OmniGAIA新基准

中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能发展方向。

PaperAgent
上一页1 / 408下一页