新闻资讯8
SaaS - Bench:AI Agent全自动办公幻想破灭
机器之心
AI 摘要
UniPat AI用SaaS - Bench测试AI Agent,发现Claude Opus 4.7通过率不到4%,多数模型表现不佳。还暴露Agent在长程任务中存在四种致命缺陷,说明离真正替人干活路还远,现有软件或需为Agent重做。
阅读原文 · 机器之心
Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想
UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Claude两个新模型曝光,或下月发布
开发者在Anthropic的API中发现Claude的两个新模型代号claude - marshmallow - eap和claude - melon - eap,目前处于内部测试阶段。社区有多种推测,且Anthropic命名风格改变,新模型或下月发布。
机器之心
新闻资讯7
Cursor:晒Claude退订截图送200美元!
Cursor员工Lauren公开喊话,让考虑切换到Cursor加Grok Bot的人发取消其他订阅截图,送一个月免费Ultra(每月200美元)。大量网友行动,但很多人私信石沉大海,有人吐槽处理慢。这或是Cursor借被SpaceX收购之势进攻Claude Code。
新智元
新闻资讯7
Fable 5.1泄露,Claude全球大宕机!
今日,Fable 5.1被曝开启灰度测试,部分Claude用户已免费试用。推测其可能很快全量推送且不涨价。此前Fable 5因性能强受限,开发者期待5.1版。同日Claude全球大宕机,Anthropic正冲刺万亿估值。
新智元
产品应用8
豆包新增模式,有望成全民AI工具
豆包工作任务新增本地电脑和云电脑切换模式,补上AI Agent关键工作条件,产品定位改变。其优势是低门槛且能力提升,虽Agent不够稳定,但有望成全民工具,推动AI进入大众生活。
刘言飞语