「Claude Agent」共找到 3743 篇相关文章
Notion、Stripe 都在用的 Agent 监控,Braintrust 会是 AI-native 的 Datadog 吗?
当 Agent 迈向产品化,开发者面临观测、评估和优化黑箱系统的挑战。Braintrust 由 Ankur Goyal 于 2023 年创立,重塑 Observability,提供 Eval 和 Ship 模块,获多家头部公司青睐与投资。文章从多方面剖析其能否成 Agent 时代‘新 Datadog’。
Agent 跑分追平 Codex、成本低至 1.95 美元,这家中国公司做到了
德勤报告显示86%多Agent项目落地失败,硅谷也出现‘无限智能体死循环’。EvoMap团队的EvoX采用‘蜂群式自进化’打法,系统容错率翻倍、完成率跃升,成本大幅降低。跑分追平Codex,还展现出自组织潜力。
Tair 短期记忆架构实践:淘宝闪购 AI Agent 的秒级响应记忆系统
本文从淘宝闪购与千问合作的‘一句话点外卖’项目出发,介绍 Tair 在 AI Agent 记忆管理中的数据模型设计、压缩策略与并发控制等关键实践,展示其在低延迟、数据建模、并发安全和弹性抗压等方面的能力。
“Claude Code更新废了”!热议Issue:思考深度下降67%,已无法胜任复杂的工程任务
AMD的Stella Laurenzo分析发现,Claude Code某次更新后思考深度降67%,无法胜任复杂工程任务,行为走样。团队回应redact - thinking是UI改动,2月两项改动或有影响,但网友并不买账。
浙大联合阿里云发布首篇 Token Economics 综述 :用经济学重新理解 LLM Agent 的 Token 世界
浙江大学联合阿里云发布综述论文,提出Token Economics框架,从经济学视角理解LLM Agent中Token使用与资源分配。梳理关键问题,构建分类体系,还指出未来发展趋势与新兴机会。
Claude最强领域被GPT反超!GPT 5.5最难编程基准破0
编程领域曾由Claude引领,如今GPT 5.5在大模型解决率为0%的最难编程基准上实现突破。程序重建基准测试(ProgramBench)考验严苛,过往模型解决率为0,GPT 5.5高和超高推理模式成功破局,展现了不同解题风格。
实测字节扣子空间:AI 播客比真人丝滑,Agent 能打 80% 的工
本文对字节跳动旗下 Agent「扣子空间」进行实测。它上线新玩法一键生成播客,相比通用 Agent 能力更丰富。此外,它还具备搜图、深度分析、写代码、开发网站等功能,兼具通用能力与低代码开发特点。
微软开源3大突破AI Agent模型,仅140亿参数超越DeepSeek-R1
微软研究院开源AI Agent推理模型rStar2-Agent,140亿参数在多测试超6710亿参数的DeepSeek-R1。其通过智能体强化学习,在训练基础、算法、流程上有三大突破,显著提升性能且降低算力成本。
阿里云百炼 AgentScope 基于容器服务的最佳实践,加速企业 AI Agent 应用落地
自 ChatGPT 发布,大语言模型成智能系统核心,AI Agent 兴起。阿里云百炼与容器服务联合发布 AgentScope on 容器服务方案,为智能体应用提供运行底座,介绍了 AgentScope 特性、容器服务能力及部署实践等。
Karpathy、Claude Code之父Boris,最新访谈,把整个程序员圈炸了!
假期红衫AI Ascent 2026上,Claude Code之父Boris与Karpathy演讲引发关注。Boris称编程执行层已解决,他用Claude App工作,全公司代码由模型生成;Karpathy提出Software 3.0概念,还谈到模型能力不均匀。两人还对面试、创业等给出看法。