「Agent S3」共找到 4536 篇相关文章
刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3
互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。
狙击Gemini 3!OpenAI发布GPT-5.1-Codex-Max
Gemini 3力压全场,OpenAI发布GPT-5.1-Codex-Max应对。它突破上下文窗口限制,能连续工作超24小时,在METR达新SOTA,推理更快,还推出xhigh推理力度选项,已支持与多种工具结合。
毕马威:企业对AI Agent智能体试点应用猛增
毕马威2025年一季度AI应用报告显示,企业对AI Agent智能体试点应用猛增,自上季度以来试点企业比例从37%升至65%,在各业务场景广泛探索,但应用中面临员工培训难题,企业也采取了风险缓解措施。
今天,被GLM-5的Agentic Coding能力惊艳到了
上月底Anthropic报告揭示编程趋势转变,月初Claude Opus 4.6与GPT - 5.3 Codex发布印证。作者深度测试GLM - 5,经两项实测挑战,发现其在复杂系统任务表现超预期,有‘系统架构师’思维。
刚刚,OpenAI发布CoT监控,增强AI Agent自主能力
今天凌晨,OpenAI发布思维链(CoT)监控技术论文,用于监督AI Agent,增强其自主性。思维链监控可调试故障、合规审计,是构建安全透明AI的蓝图,文中还提及CoT监控必要性及有效方法。
评估工程正成为下一轮 Agent 演进的重点
文章指出传统软件工程测试方法难用于 AI 系统,促使评估工程成 Agent 演进重点。它贯穿 AI 生命周期,正走向体系化。介绍评估工程发展阶段,还提及阿里云 RM - Gallery 和云监控 2.0 实践。
对话冯雷:从 AI 播客,到真人感 Agent
本文是对ListenHub创始人冯雷的对话记录。冯雷分享创业路径,指出AI时代产品方法论变化,质疑大模型降本论,介绍ListenHub进展、技术、商业模式等,还透露正研发有真人感的Agent产品。
ACL 2026 | 腾讯混元Agents工具学习新范式
腾讯混元团队在 ACL 2026 Findings 发布的 ToolCPT 指出,Agent 用不好工具病根在预训练。它从真实代码挖工具,写说明书,融入预训练,实验显示能有效提升工具运用能力,但也有局限和成本。
刚刚,Kimi K3开源!3万亿模型权重全球开放
2026年7月27日,Moonshot AI开源全球首个3万亿参数级模型Kimi K3。它不仅参数量大,还在多领域表现出色,能与顶尖闭源模型媲美。其架构创新、训练独特、推理成本低,有望改变全球大模型格局。
谷歌又来砸饭碗!免费AI Agent发布,程序员狂喜
谷歌发布免费开源的AI Agent——Gemini CLI,可在电脑终端运行。免费额度高,用个人谷歌账号登录就能用Gemini 2.5 Pro,还有大上下文窗口和高请求额度。它能力不止编码,功能强大且易上手。