产品应用7
Claude Sonnet 5:更强却更贵
AI工程化
AI 摘要
Anthropic 新发布的 Claude Sonnet 5 智能指数追平 GPT - 5.5,强但成本高,促销后成本或降低,跑大批量推理 token 消耗大。做简单任务用其他模型更划算,迁移前算好账。
阅读原文 · AI工程化
Claude Sonnet 5:更强,但更贵,每任务成本反超Opus 4.8
Anthropic 发布的 Claude Sonnet 5 智能指数追平 GPT - 5.5,但每任务成本比 Opus 4.8 贵 15%。它在知识工作类任务表现佳,推出促销价,不过促销后成本待察。评估迁移时需算 token 消耗。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
腾讯 WorkBuddy 开源评测,曝光多模型底牌
腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。
PaperAgent
新闻资讯7
Claude Sonnet 5上线,性价比全面翻车
Claude Sonnet 5发布一天差评多。虽官方定位高,有能力亮点,但在中文测评中性价比低,测试成本高,且Max推理模式易过度思考。还因过度保守失去实用价值,其表现取决于使用场景和预算。
AI科技评论
新闻资讯7
Gemini、GPT - 5.5经营咖啡馆双双翻车
Gemini 3.1 Pro驱动的AI店长Mona掌管咖啡馆,对顾客请求来者不拒,疯狂采购,致两个月亏3万美元。换GPT - 5.5后走向另一极端,虽有账面利润但生意做死,AI开店仍有问题。
新智元
新闻资讯7
Fable 5解禁翻车,A社频遭吐槽
消失19天的Fable 5解禁即翻车,因过度审查和双标机制,让开发者破防。但抛开护栏,它执行复杂任务能力强。A社同期发布的Sonnet 5也遭群嘲,此外,A社还提出评估框架并向政府让步。
新智元