自动化评估工具」共找到 2886 篇相关文章

新闻资讯7

Anthropic智能体大会:Agent也会精神分裂,我们发现了多Agent协作的本质解法。

Anthropic开发者大会聚焦Agent,分享多智能体实战经验。Omni的Blobby出现‘精神分裂’问题,根源是内外层Agent能力认知断裂,修复方案是将工具上提。Anthropic团队则通过协商签订协议解决角色定义不一致问题。

探索AGI
产品应用8

国产新模王Qwen3.7-Max,海外开发者已经沸腾了

阿里通义千问团队发布的 Qwen3.7-Max,或为面向 Agent 时代的旗舰模型。它能自主跑 35 小时、完成 1158 次工具调用,内核优化不掉线,多项评测领先,应用场景丰富,已上线且兼容主流框架。

AIGC开放社区
新闻资讯8

帮大家总结了一下凌晨的Google I/O 2026开发者大会。

本文总结Google I/O 2026开发者大会成果,涵盖AI模型、产品、Agent系统、视觉生成、搜索、电商等多领域。如推出Gemini 3.5 Flash,升级产品功能,发布新Agent系统,推进电商协议,还有科研成果与硬件更新。

数字生命卡兹克
新闻资讯7

Kimi总裁张予彤北大实录:我们想要有抽象能力和偏执的人|甲子光年

Kimi总裁张予彤在北大分享,谈AI时代人才标准,偏好有抽象能力和偏执的人。还探讨AI创造新工作、学校课程设计、企业管理等问题,分享Kimi招人标准、组织特点及对行业诸多问题的看法。

甲子光年
产品应用7

回敬 Codex,Claude Code 推出 /goal 功能,不干完不睡觉

Claude Code随2.1.139版本推出 `/goal` 命令,设定完成条件后可持续工作至目标达成。它与Codex互相借鉴功能,且在设计上采用裁判分离,官方也给出目标制定建议,还带来其他更新。

AGI Hunt
推荐文章7

告别“氛围编程”:基于 Harness 治理和 SDD 的团队级 AI 研发范式演进与实践

本文作者王树新分享团队级AI研发范式演进与实践。指出AI Coding存在自由发挥、效率降低、关键信息丢失问题,分析出码率提升却未提效的原因,引入SDD与Harness解决问题,并介绍全流程自动化实践。

阿里云开发者
开源动态7

免费开源低成本的3D动作捕捉系统

FreeMoCap是无标记点3D动作捕捉系统,用普通USB摄像头就能实现研究级全身动作捕捉,支持单/多相机模式,输出3D骨骼数据,可导入Blender等工具,具有低成本、开源可扩展等优势。

GitHubStore
算法论文8

OpenClaw代码越改越崩?新研究EvoClaw揭示:Agents持续开发成功率仅13.37%

USC邓港大等联合发布评估基准EvoClaw,揭示AI在持续开发场景下表现不佳,成功率仅13.37%。研究还指出当前评测易高估AI能力,提出DeepCommit重构演进历史,分析各模型在持续演进中的局限与问题。

量子位
推荐文章8

从 0 到 25 万行:一个 100% AI 编码项目,真正难的不是生成,而是治理

作者分享 Routa 项目用 AI 驱动开发的经验,指出 100% AI 编码项目真正难的是治理。介绍多个工具参与情况,阐述项目长出反馈系统的过程,包括规则入口、上下文收敛、提交前约束及仓库级裁决等。

phodal
开源动态8

如何定义“人味儿”?——HeartBench评测体系建设实践

在大模型竞争格局生变,情感智能评测缺失的背景下,作者团队发布聚焦AI拟人化的中文评测体系HeartBench,介绍其设计、评估方式、迭代过程等,还沉淀了评测体系构建方法论及专家标注管理思考。

阿里云开发者