开源动态8
WildClawBench评测AI,国产模型崭露头角
机器之心
AI 摘要
上海AI Lab InternLM团队推WildClawBench,用60道难题评测AI Agent。目前最强Claude Opus 4.6刚过51分,国产智谱GLM 5第三,成本低。该项目开源,为衡量AI能力提供标尺。
阅读原文 · 机器之心
OpenClaw大考!上海AI Lab InternLM团队WildClawBench 60题,把「龙虾」AI打回原形
上海人工智能实验室InternLM团队推出WildClawBench,含60道高难度任务,在真实OpenClaw环境端到端评测AI Agent。评测涵盖多类别任务,已测14个模型,国产模型表现亮眼,项目开源可复现。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
智谱、阿里新模型亮相,性能屠榜!
智谱发布GLM - 5.3 - Flash(牛来模型),原生多模态,支持1M token上下文,运行在国产芯片,价格实惠。阿里开源Qwen3.8 - Flash - Next权重,成本低性能优,在四大维度重构架构。
AI寒武纪
产品应用8
SemaPLC:让AI编程在PLC开发可交付
上海交通大学联合Sema研究团队推出SemaPLC,将AI Agent与PLC工程工具链连接,让自然语言需求转化为可编译、验证、仿真的控制程序。它是面向全流程的智能工作台,实验效果优于业界方案。
量子位
开源动态8
Headlong:让AI Agent成为主动思考的“同事”
Laude Institute的AI Agent Audel在无指令下自动修复bug,背后是开源的AI Agent微框架Headlong。它与其他Agent不同,其Agent永远不睡觉,核心由9800行Bash脚本构成,安装简单,提出AI主体性问题。
开源星探
推荐文章7
Vasuman:企业 AI 采用率指标是个笑话
一家公司买企业级 AI 授权全员铺开,虽 88% 员工采用,但交付速度未变,仅 10% 的人烧掉 90% 的 Token。文章指出企业 AI 采用率指标荒诞,分析企业 AI 应用现状,还给出落地推进建议。
特工宇宙