算法论文8
ClawBench:AI agent真实网站任务集体翻车
机器之心
AI 摘要
研究团队发布ClawBench评估框架,让AI在真实网站执行任务,结果显示Claude、GPT、Gemini等模型集体翻车,暴露真实环境交互问题,离‘AI替人干活’还有巨大差距。
阅读原文 · 机器之心
33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形
ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用7
Anthropic:Claude后台接管电脑,人机并行时代来了
Anthropic宣布全面升级Claude「计算机使用」能力,操作可在后台完成。该功能处于Beta测试,已向Claude Pro和Max订阅的macOS用户开放。Claude此次更新覆盖多场景,人机并行时代或来临。
新智元
新闻资讯7
谷歌Gemini 3.8来袭,AI混战升级
最新爆料,Gemini 3.8 Flash明日登场,谷歌已放弃Gemini 3.5 Pro。其编程实力强悍,之前还为Gemini植入智能体视频理解功能,降本提效,可应对多种高难度场景。近期多家AI发布计划撞车,混战升级。
新智元
产品应用7
Anthropic 发布 Fable 5.1 提示词指南
Anthropic 发布 Fable 5.1 后,同步发布《Prompting Claude Fable 5.1》提示词指南,列出 15 个 5.1 跟 Fable 5 在行为上的差异,并附修正提示词。还介绍了 Fable 5 提示词变化,以及 Fable 5.1 的新特性和应对建议。
AGI Hunt
产品应用8
Claude Fable 5.1发布,性能价格双优!
Anthropic发布Fable 5.1和Mythos 5.1,8项基准测试夺冠,价格最高降45%。展示科研成果,如蛋白质设计、生成金星地图等。上线反蒸馏机制,防止篡改上下文,还给出替代方案。
量子位