自动化评估工具」共找到 2880 篇相关文章

推荐文章8

翁荔最新博文深度拆解Scaling Laws:AI行业最信赖的公式,没有那么可靠

6月24日,前OpenAI安全研究副总裁翁荔在博客发表长文,对缩放定律进行系统梳理,指出该理论在实际拟合和外推过程有易被忽视的陷阱,还讨论了数据有限时定律是否成立等问题。

DeepTech深科技
产品应用8

马斯克悄悄改了战场:Grok Build 0.2.60 剑指 Agent Runtime

2026年6月21日,Grok Build发布0.2.60版本更新,未推新模型能力,而是聚焦Runtime细节,针对会话难恢复、长任务易卡住、工具输出易污染上下文等痛点优化,让Agent更稳定可靠。

AI科技评论
产品应用7

Claude Code 修了几个小 bug,却揭开了 Agent 落地的大麻烦

Anthropic给Claude Code发的更新,看似是修小bug,实则指向AI编程产品正从“模型会不会写代码”转向“Agent能否稳定完成任务”,暴露了工具状态、权限边界等执行问题。

AI科技评论
推荐文章7

企业级 AI Agent:彻底说清 MCP、CLI、Skills,如何定位、该怎么选、最佳实践。

文章解读了 MCP、CLI、Skills 三者定位、组成与工作层次,介绍工具选择方法,强调组合应用以发挥企业 Agent 最大效能,还指出 MCP、CLI、Skills 使用误区及 PTC 应用模式等。

AI大模型应用实践
产品应用7

QoderWork Design 上线,设计即代码,不输 Claude Design

阿里 QoderWork 上线设计工作台,定位用自然语言做专业设计。与 Claude Design 接近平手且小有优点,有 140 种风格参考,画笔和 Nudge 工具方便修改,产出可直接用于开发的工程文件。

AGI Hunt
产品应用8

17岁高中生做出AI神器:看一下视网膜,就能识别自闭症和多动症

美国17岁高中生Edward Kang开发AI工具RetinaMind,通过视网膜图像识别自闭症和多动症,准确率达89%,还能分析疾病基因机制。该成果助他获2026年Regeneron科学天才奖二等奖及奖金。

DeepTech深科技
算法论文8

ICML 2026 | 大模型内部也会长出「情绪树」,规模越大越懂人心

ICML2026 论文指出,大语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型越大,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。

机器之心
算法论文8

0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench作者新作把AI圈干沉默了

SWE - Bench创建者推出新benchmark ProgramBench,测试AI从零构建软件系统能力。结果一线模型完成率0%,暴露AI擅长局部代码生成,缺全局系统规划能力,引发对其评估方式的讨论。

机器之心
产品应用8

Qoder CLI + Harness Engineering 实战:构建 7×24h 无人值守用户反馈自动处理系统

在 Qoder 产品用户反馈增多、人力处理流程痛点凸显的背景下,构建 7×24 小时无人值守的用户反馈自动处理系统。该系统分四个核心模块,基于 Qoder CLI 实现,显著提升处理效率。

阿里云开发者
算法论文8

π0.7来了!涌现出组合泛化、跨本体迁移能力,VLA又行了?

具身赛道玩家 Physical Intelligence 发布新模型 π 0.7,它展现出组合泛化和跨本体迁移能力,还能通过知识蒸馏学会优化技巧。其强大源于杂数据和细提示,未来有望解决复杂任务。

机器之心