系统评估」共找到 2286 篇相关文章

推荐文章8

Anthropic 的 Harness 设计:build to delete

Anthropic工程博客发布Harness设计文章,探讨Claude完成全栈应用开发任务。指出单Agent模式问题,采用GAN式对抗、三Agent编排,对比单Agent与多智能体产出,还介绍调教评估者及编排简化,提出Build to Delete原则。

AGI Hunt
算法论文8

在AI社会抓「内鬼」?上海AI Lab推出首个多智能体极端事件解释框架

2023年起多智能体系统成人类社会数字镜像,但复杂系统会自发涌现极端事件。上海AI Lab等团队推出解释框架,用沙普利值拆解风险,发现极端事件五大演化规律,还能提前防控风险。

机器之心
产品应用7

以前写文排版60分钟,现在 Claude Code 3分钟

作者分享AI写作系统,用AI梳理复杂逻辑生成配图,进行个性化排版、一键出稿。介绍必需工具如Obsidian、PicGo、Claude Code等,还提供具体配置教程、进阶玩法,如规范写作、生成逻辑图、定制风格。

AI产品自由
新闻资讯8

OpenAI 3万亿美元测试,AI首战44个行业人类专家!

OpenAI推出GDPval评估体系,通过真实工作任务审视大模型潜力,揭示AI从实验室走向3万亿经济战场的可能。早期测试显示,Claude Opus 4.1表现最佳,GPT系列进步快,模型在部分任务逼近人类专家水平。

新智元
推荐文章7

AI窗口期只剩3-4年,98%的企业却高估了自身的技术成熟度

麻省理工学院报告显示,企业级AI试点仅约5%进入生产环节并产生回报。多数企业高估自身AI成熟度,落地难源于技术与组织发展速度不匹配。企业需系统重构,窗口期只剩3 - 4年。

AI前线
新闻资讯8

五份专利曝光,长文拆解特斯拉V3灵巧手技术路线

特斯拉Optimus人形机器人量产计划因灵巧手难题被搁浅。4月16日,世界知识产权组织公布其第三代灵巧手5项专利,文章从整体构型、前臂、手腕等方面拆解其技术路线,各部分紧密协作,体现系统思维。

AI科技评论
推荐文章8

Harness is the New Dataset:模型智能提升的下一个关键方向

文章指出当基模能力成熟,决定 agent 上限的是围绕模型搭建的系统,即 harness engineering。介绍其组件、设计原则,探讨模型与 harness 关系,还列举创业机会项目,最后推测下一范式是 Coordination Engineering。

海外独角兽
新闻资讯7

AI 正在毁掉开源:从“协作圣地”到“垃圾洪水”,维护者士气跌至谷底,开始集体掀桌

AI Slop正破坏开源开发中维护者与贡献者的社会契约,贡献数量使系统不堪重负。文章探讨AI Slop时代开源现状、维护者应对方式,还提及基金会政策、极端选项、激励问题,并给出最终建议。

InfoQ
算法论文8

告别「一条路走到黑」:通过自我纠错,打造更聪明的Search Agent

为解决知识实时性和推理复杂性挑战,搜索智能体(Search Agent)应运而生,但缺乏自我纠错能力。腾讯联合清华提出 ReSeek 框架,引入动态自我修正机制,还构建 FictionalHot 数据集评估,实验效果良好。

机器之心
新闻资讯8

濒死3次,医生判他死刑!宾大教授奇迹自救,誓用AI攻克14000种绝症

宾大教授David Fajgenbaum多次濒死自救成功,创立Every Cure,借助AI系统MATRIX在7500万种药病组合中找治疗方案,已帮多名患者,还计划公开预测结果,用AI+人类模式助力医学。

新智元