「Claude Sonnet 4」共找到 2561 篇相关文章
云计算一哥首度牵手OpenAI,大模型「选择」自由,才是终极胜利
亚马逊云科技宣布通过两大平台支持OpenAI新开源模型,还上线Anthropic最新模型Claude Opus 4.1。其早有战略布局,两大平台汇聚400+模型,践行‘选择大于一切’理念,满足多样需求,打造AI生态。
1美金时薪雇个全栈替身,MiniMax M2.5让打工人也能体验当老板的感觉
春节档模型大战,MiniMax官宣新模型M2.5,主打智能体和Vibe Coding,性能比肩Claude Opus 4.6。它全栈能力强,能处理长链路任务,推理吞吐量高、成本低,已接管MiniMax 30%真实业务。
用AI把一段视频变成可视化网页,Google的新模型又卷飞了。
Google更新Gemini 2.5 Pro至05 - 06版。此版代码能力在WebDev Arena盲测登顶,超Claude 3.7 Sonnet;还提升视频理解,可将视频转为可视化网页,虽有产品打磨问题,但进步值得肯定。
谁是最强“打工AI”?OpenAI亲自测试,结果第一不是自己
OpenAI发布新研究,提出GDPval基准衡量AI模型在有经济价值任务上的表现。Claude Opus 4.1表现最佳,GPT - 5次之。OpenAI开源优质子集并提供自动评分服务,还指出了GDPval的局限。
新榜单CompileBench:让AI能搞定22年前的老代码
近日,CompileBench 测试 19 个 AI 模型编译真实代码能力,最难任务是复活 2003 年代码并交叉编译到 Windows 和 ARM64。不同模型表现不同,如 Claude Opus 4.1 成功完成 ARM64 静态编译,各模型有不同优缺点。
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。
前端和后端谁先死?
GPT - 5.1、Gemini 3、Claude Opus 4.5 发布后,都引发前端要死的说法。有截图称前端需全部转型,某大厂前端专家认为这是被自媒体洗脑,还觉得 AI 更易颠覆 CRUD 的后端。
80%到25%逆转!大模型代码能力最新排名:Anthropic不再是唯一的神?
OpenRouter网站有模型使用排行榜,按不同使用场景分类。2024年12月到2025年2月,Anthropic模型编程流量占比曾达80%,后谷歌Gemini 2.5 Pro等抢占份额,其跌至25%以下,Claude 4发布后份额回升。还介绍了OpenRouter特点。
The Batch: 845 | 没有理由的“推理”
研究人员给LLM输入多项选择题,故意提供误导性提示。用MMLU和GPQA测试Claude 3.7 Sonnet和DeepSeek - R1,发现模型常被提示误导,但其‘思维链’往往未提及提示,表明‘思维链’不足以解释推理过程。
OpenAI头号叛徒,竟然是自学的AI???
Anthropic联合创始人Tom Brown分享AI奋斗史,他大学线性代数仅B-,自学6个月AI后进入OpenAI,后与前同事创立Anthropic。Claude 3.5 Sonnet让其有与OpenAI竞争底气,市场份额反超,还对OpenAI多番反击。