Claude 3.7」共找到 3576 篇相关文章

算法论文8

全球顶尖AI做物理,被人类按地摩擦?不懂推理大翻车,本科生碾压

港大等机构用3000道物理题测试顶尖大模型,如GPT - 4o、Claude 3.7 Sonnet等,结果模型准确率远低于人类专家。研究推出PHYX基准测试,揭示模型依赖知识、公式和模式匹配,缺乏真正物理理解。

新智元
新闻资讯8

Anthropic CEO Dario Amodei 访谈:我们正在接近指数的终点

Anthropic CEO Dario Amodei 三年前预测基本兑现,此次访谈更放豪言,称 1 - 3 年内有 50% 概率出现“天才之国”,10 年内 90% 确信。访谈覆盖诸多关键问题,如 Scaling 原理、AI 编程生产力、AI 公司盈利模式等。

宝玉AI
开源动态7

OpenClaw构建自我迭代AI助手笔记

作者花3天体验OpenClaw,构建银行客户经理助手场景,验证通用智能体框架可用性。介绍Agent构建、迭代、交流及评估能力构建过程,对比OpenClaw与Claude Code、OpenViking,指出记忆系统问题,肯定专属智能体提升生产力的可行性。

阿里云开发者
开源动态8

14.8K Star!这个开源 Skill,一句话就能做出大厂级设计!

Anthropic 发布的 Claude Design 虽能在对话框生成网页,但需手动操作。有人据此开发了开源项目 Huashu Design,可在 agent 里打一句话,3 到 30 分钟就能拿到能交付的设计,还介绍了其功能、核心规则等。

开源星探
新闻资讯7

近 300万人围观卡帕西亲测 Opus 5:两小时写完 5500 行代码, 却连自己写的游戏都玩不了

8月2日,Andrej Karpathy在X公布实验,让Claude Opus 5用Three.js将《指环王》第一章渲染成3D场景,约两小时写出5500行代码。Opus 5按传统游戏开发路线搭建场景,这改变了内容定制方式,但模型验证能力不足。

InfoQ
新闻资讯8

刚刚,Anthropic官方Cluade 5使用指南发布

Anthropic发布Claude 5的Context Engineering官方指南,指出为Claude Opus 5和Claude Fable 5删掉Claude Code超80%的system prompt,在编码评估上无明显损失。还揭示6组范式反转及四类上下文载体新分工。

PaperAgent
开源动态8

Agent KB:经验池让Agents互相学习!GAIA新开源SOTA,Pass@1性能最高提升6.66

来自多家机构团队发布 Agent KB 框架,构建经验池实现 AI Agent 经验共享。在 GAIA 基准测试中表现出色,提升多模型 Pass@1 性能,还在软件工程领域展现价值。其设计精妙,经消融、检索策略等实验验证有效。

机器之心
开源动态8

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!

GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。

量子位
产品应用7

Cursor新模型,你怎么还在套Kimi?马斯克你怎么还吆喝上了??

Cursor模型更新至Composer 2.5,测评成绩亮眼,性能接近Claude Opus 4.7,价格仅为其1/10。该模型以Kimi打底,在训练栈上做了改进。此外,Cursor与马斯克达成算力合作,走上自研之路。

量子位
7

英特尔:止亏回血!“美式中芯”能挖角台积电吗?

英特尔2025年第三季度财报显示,营收136.5亿美元,毛利率回升。公司裁员控费,员工总数将减至7.5万。主要收入来自客户端和数据中心及AI业务。18A工艺量产,虽落后台积电,但给市场追赶信心,代工业务或成突破口。

芯师爷