「验收标准」共找到 358 篇相关文章
别再问什么工作被AI取代!Karpathy直指本质:你的工作「可验证」吗?
前特斯拉AI负责人Andrej Karpathy提出,软件1.0自动化能指定的任务,软件2.0自动化能验证的任务。判断任务能否被AI接管,关键看是否满足可重置、可高效试错、可自动奖励三条准则。
这篇超有用!手把手教你搭建 AI 产品 Evals
文章指出AI下半场模型评估比训练更重要,做好Evals是当下AI产品开发刚需。介绍了Evals重要性、三种方法、通用评估标准等,还教你从零构建Evals及设计注意事项,助你快速上手评估。
Meta首席科学家LeCun:当前 AI 模型缺乏四项关键人类智能特质
在巴黎AI行动峰会上,Meta首席AI科学家Yann LeCun提出智能四项标准,指当前主流AI系统尤其语言模型在这些方面不足。他认为业界‘组合式’增强是‘功能修补’,介绍Meta‘世界模型’及V-JEPA模型。
Auto-Research「终极大考」:新基准撕下大模型科研伪装
来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。
Claude写完代码不直接交了:4个Skill自查一遍,改好再找你
Anthropic将AI验收纳入循环,让Claude写完代码后进行四道检查才交付,定义了验证循环,Claude Code团队有4个自查Skill,还介绍了写验证Skill的方法、触发设置,AI编程竞争正从生成转向验证。
能进化的Skill,才是好Skill~
2026年,我们追求“越干越好”的Agent。AutoSkill和XSKILL两篇论文指出,静态的Skill只是高级Prompt,能自我进化的Skill才是真正的数字资产,还介绍了两者的设计、优势及未来Skill的标准形态。
从“云原生”到“智能原生”,AI中间件走到哪一步了?
InfoQ直播栏目邀蚂蚁集团专家探讨AI中间件基建,指出其核心价值,如降低开发门槛等。还谈及云原生到智能原生的转变、记忆服务定位、自研必要性等,分析未来挑战与方向,10月上海QCon大会将聚焦相关话题。
ChatGPT推出即时结账,比Claude发布重要得多
OpenAI宣布在ChatGPT推出即时结账功能,用户可在聊天界面直接购买,首批合作商家有Etsy,Shopify超百万商家将加入。由ACP驱动,是开源标准。资本市场反应好,社区反应不一,这标志AI助手向交易平台转变。
南大等8家单位,38页、400+参考文献,物理模拟器与世界模型驱动的机器人具身智能综述
当下,具身智能成研究热点。南大等8家单位学者撰写综述论文,指出物理模拟器与世界模型融合是实现具身智能的潜力路径。论文系统梳理两者协同推动机器人演进全貌,还提出分级标准等内容。
论文秒变海报!开源框架PosterAgent一键生成顶会级学术Poster
本文介绍开源框架PosterAgent,它能一键将论文转为可编辑的学术海报。相比GPT - 4o,其生成指标优、token使用量少、成本低。研究团队构建评估标准Paper2Poster,实验显示PosterAgent在多方面表现出色。