Claude Agent」共找到 3753 篇相关文章

开源动态8

Kimi K2发布两天即“封神”?80%成本优势追平Claude 4、打趴“全球最强AI”,架构与DeepSeek相似!

国内独角兽月之暗面发布并开源 Kimi K2 模型,推出两天就在 OpenRouter 平台 token 使用量超 xAI 的 Grok 4。它成本低、性能强,编码能力追平 Claude 4,架构与 DeepSeek 相似,技术研究也多次‘撞车’。

InfoQ
开源动态7

小红书发布 SWE-Bench Mobile:当 AI Agent 面对亿级用户 App 代码库,最高通过率仅12%?

小红书联合多科研机构发布 SWE-Bench Mobile,它是首个还原‘端到端’开发流程的基准,以小红书 App 实际任务为核心。评测显示,AI Agent 在移动端开发能力上限低,架构设计比模型本身重要,简单提示策略效果更好。

InfoQ
新闻资讯7

Claude Code越更越废?!大厂AI主管公开怒喷思考深度暴跌,官方回应更被怼爆 :菜成AI“玩具”

开发者 Stella Laurenzo 分析称,Claude Code 在 2 月更新后,思考深度下降 67%、算力消耗大增,无法用于复杂工程任务。她提出改进建议,开发者对此认同,负责人回应遭反驳,部分人考虑转用 Codex。

AI前线
产品应用8

推出4个月就狂赚3亿?!百万用户应用CTO弃Copilot转Claude Code:200美元拯救我的137个应用

Anthropic 公司推出的 AI 编码助手 Claude Code 推出 4 个月吸引 11.5 万开发者,单周处理 1.95 亿行代码,年化收入预估达 1.3 亿美元。开发者认为它优势明显,Soham 级别的生产力,还分享使用技巧。

AI前线
开源动态7

Claude时代终结?LMArena实测DeepSeek R1编程得分超Opus 4,但月暗称其新模型更胜一筹

在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分超Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩超R1。

AI前线
新闻资讯7

GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍

Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。

量子位
新闻资讯8

“商业的HTTP”来了:谷歌CEO劈柴官宣 UCP,Agent 直接“剁手”下单,将倒逼淘宝京东“拆家式重构”?

谷歌CEO近日宣布开放标准UCP,目标是让Agent在线购物,将购物流程拆解成可复用组件。风险投资人认为其想成商业领域的“HTTP”,不少行业人士看好。它还能与其他协议协同,发布首日吸引众多伙伴。

InfoQ
7

从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!

90后华裔女高管Cat Wu推动Anthropic产品“按天迭代”,她认为token成本低于工程师工资。她分享了产品发布、团队协作等经验,还谈到AI时代PM应具备的能力,以及Claude系列产品的使用和发展方向。

InfoQ
算法论文8

Agentic RL训练:它不是单一 RL 算 法,而是一整套环境建模、学习信号、异步数据流、策略优化和基础设施的协同系统

文章指出Agentic RL训练不是单一算法,而是协同系统。它与传统RL不同,有四个训练变化。理解它要围绕三个不变量,还从环境建模等八个方面阐述,强调其竞争在于环境、信号、分布与系统的协同闭环。

深度学习自然语言处理
产品应用7

【实测&解读】全球首个手机通用Agent——AutoGLM 2.0发布!我喝到了AI为我点的第一杯咖啡~

智谱更新的AutoGLM 2.0是全球首个手机通用Agent,适配苹果和安卓手机,无需交出手机使用权。它配备云手机和云电脑,由GLM - 4.5和GLM - 4.5V驱动,能完成点咖啡等多场景任务,因风险控制付款需人确认。

花叔