算法论文7
Claude 3.5 Sonnet售货运营夺冠
新智元
AI 摘要
研究人员用Vending - Bench测试大模型管理自动售货机能力。Claude 3.5 Sonnet净资产表现佳,人类基线可靠性好,各模型长周期表现波动大,经济活动随时间减少。
阅读原文 · 新智元
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章7
中国AI突破,Agent接管芯片设计全流程
RSI成人工智能前沿方向,芯片设计因有确定性验证体系,成其率先落地赛道。NovaSilicon完成融资,探索出芯片设计智能系统,发表论文介绍构建运行方法,将重塑行业。
新智元
新闻资讯7
Vercel v0 API:开启全程可编程应用开发?
Vercel 推出 v0 API,让开发者能以编程方式访问其 AI 应用构建智能体,支持多种请求与外部工具。它将应用构建智能体作为基础设施开放,社区关注其对全程可编程应用开发的支持潜力。
AI前线
新闻资讯7
英伟达400亿押注开源,图谋AI生态
英伟达被曝砸60亿美元押注开源模型,向Poolside投资10亿美元并买其‘模型工厂’技术非独家使用权。它主张闭源开源两手抓,此前已发布系列开源模型、组建联盟,开源布局广泛。
量子位
新闻资讯7
AI调用AI:token用量半年涨14倍
据OpenRouter统计,截至8月10日,Agent类token用量半年涨14倍,人类仅2.8倍。差距源于用法差异,虽智能体部分token计价低,但用量大仍烧钱。省钱关键在配套,且智能体任务验收缺人手。
新智元