新闻资讯7
Claude Sonnet 5上线,性价比全面翻车
AI科技评论
AI 摘要
Claude Sonnet 5上线遭差评。在中文测评中性价比低,测试成本是国产模型6倍多。虽在多步Agent和编程上有亮点,但Max推理模式成本高,还过度保守,是否值得用取决于场景和预算。
阅读原文 · AI科技评论
Claude Sonnet 5 上线一日差评刷屏:打不过千问和 Minimax,性价比全面翻车
Claude Sonnet 5发布一天差评多。虽官方定位高,有能力亮点,但在中文测评中性价比低,测试成本高,且Max推理模式易过度思考。还因过度保守失去实用价值,其表现取决于使用场景和预算。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Google 6 周 3 次升级,发布 Gemini 3.8 Flash
Google DeepMind 官宣发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两个新模型。3.8 Flash 在软件工程等方面有显著提升,跑分成绩亮眼,价格实惠,性价比高;3.8 Flash Cyber 面向网络安全场景。目前 3.8 Flash 已在多平台上线。
AGI Hunt
新闻资讯7
OpenAI Astra核心架构:循环深度引争议
The Information记者爆料OpenAI即将推出的Astra模型采用“recurrent depth”新推理方法,该技术能降本提效,但引发AI安全与可观测性担忧。清华与字节论文解决了循环模型“算力不公平”问题,并给出Scaling Law。
AI寒武纪
产品应用7
Agent助力Diffusion模型多方面优化
本文记录基于Agent完成Qwen-Image、FLUX.2、Wan和SANA Video优化的过程,包括定位问题、写Kernel及遇到的坑。介绍SGLang Diffusion Kernel结构,分析数值敏感原因,展示各模型优化实践、无收益实验及验证流程。
GiantPandaLLM
算法论文8
吴恩达:丢弃推理token可提速3倍
吴恩达新作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练能将推理轨迹扩展到10万token以上。该方法为Agent场景提供新思路。
PaperAgent