「产品测试」共找到 3242 篇相关文章
AgentIF-OneDay 发布,评估全场景长时复杂任务
红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。
全靠Claude Code 10天赶工上线,Cowork 删用户11G文件不含糊!核心研发:长时间打磨再发布很难成功
Anthropic发布的Claude Cowork研究预览版问题频出,如删用户文件、易受文件窃取攻击等。与Claude Code相比,它交互繁琐、效率滞后。不过其核心研发认为长时间打磨再发布难成功,未来将以用户反馈迭代。
MiniMax都在用!5500PB幕后功臣首次亮相,国产黑马祭出杀招
AI浪潮中,数据流不动致GPU算力空转,XSKY星辰天合举办AIMesh产品战略发布会破局。AIMesh含三网,分别解决IO墙、重力墙、内存墙问题,且开放解耦,获多方认可。
MiniMax 上市后的第一个开源:给 Coding Agent 立个规矩
2026 年初 MiniMax 成功上市港股,市值达 1100 亿港币。其上市后首个开源项目 OctoCodingBench 聚焦 Coding Agent 评估,解决规则复杂时 Agent 合规问题,为其立规矩,有重要社区价值。
Manus走了,原生Agent登场:“AI助手”的第三次重新定义
文章回顾“AI助手”三次预期校准,指出Manus完成Agent启蒙使命,随后分析Agent发展现状,提到其将从炫技到日常,还指出Chat时代落幕,中国模型创业者正加速,探索谁能成“中国的Anthropic”。
分化、新范式、Agent 与全球 AI 竞赛,中国模型主力选手们的 2026 预测
AGI-Next 2026活动聚集众多国内大模型核心人物,「海外独角兽」总结出40条重要判断。涉及模型分化、新范式(自主学习、原生多模态)、Agent、全球AI竞赛等方面内容,对AI未来发展趋势做出探讨。
GPT-5.2考赢人类!OpenAI警告:大模型能力已过剩,AGI天花板不是AI
GPT - 5.2在ARC - AGI - 2基准测试超人类,Poetiq系统让其准确率从60%提至75%。OpenAI称大模型进入‘能力过剩’阶段,未来AGI进展不止靠模型,更需人机协同。
谷歌 Gemini API 负责人自曝:用竞品Claude Code 1小时复现自己团队一年成果,工程师圈炸了!
谷歌主管工程师 Jaana Dogan 称,用竞品 Claude Code 一小时就生成了接近自己团队一年成果的系统。她公开评价引发争议,也让大家思考‘一年工程 vs 一小时生成’背后被压缩的是什么。
Meta详细阐述基于LLM级训练、混合并行计算与知识迁移的GEM广告模型
Meta发布生成式广告模型GEM详细信息,旨在改善平台广告推荐能力。它处理海量用户 - 广告交互数据,用三种方法构建系统,还实施GPU级优化,采用两种知识迁移策略,获业内人士认可。
Gemini 3 Flash 发布,多、快、好、省,Coding 能力不输大哥Gemini 3 Pro
Google DeepMind 发布 Gemini 3 Flash,成本极低。它在多项测试表现出色,速度快、效率高,代码能力超 Gemini 3 Pro,获企业客户好评,今日起向全球开发者和普通用户推送。