开源动态8
FDABench:首个Data Agent基准测试登场
量子位
AI 摘要
南洋理工等机构开源FDABench基准测试,含2007个任务,覆盖异构数据源。研究人员用其测试常见数据智能体,发现不同架构各有优劣,FDABench可助选合适系统。
阅读原文 · 量子位
首个Data Agent基准测试来了!2007个测试任务将数据库、PDF、视频、音频异构数据源一网打尽
南洋理工大学、新加坡国立大学与华为开源首个针对数据智能体异构混合数据分析的基准测试FDABench。它有2007个任务,覆盖多领域多数据源,独创协作框架,能测多种工作流模式的数据智能体。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
J-Space让V4 Pro超Fable 5?测试结果翻车!
前两天J-Space凭夸张测试结果刷屏,宣称一份Skill接入Agent环境,能让V4 Pro在多基准大幅提升,部分成绩超Fable 5。但社区复测结果相反,作者未公开完整评测记录,还删质疑帖,引发公开打假。
机器之心
开源动态7
Stripe测试:AI智能体校验环节有短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
InfoQ
新闻资讯8
ALE考试:AI距替人干活还差得远
AI飞速进步,人类最后考试(HLE)已不够用,伯克利牵头推出智能体最后的考试(ALE)。ALE真实、全面、可验证,当前最强AI在最难档通过率仅8.6%,主流系统平均2.6%,显示AI距替人干活尚远。
AIGC开放社区
新闻资讯7
GPT-5.5 性能领先,幻觉问题突出
OpenAI 最新旗舰模型 GPT-5.5 是闭源视觉 - 语言模型,在重要基准测试中表现领先,但在区分已知未知内容上有困难,幻觉问题突出,在主观评估中落后于对手。
DeeplearningAI