质量评估」共找到 1287 篇相关文章

新闻资讯7

全国首部“高质量数据集验收”标准,现公开征集起草单位和专家!

国家数据局等明确支持数据流通服务机构与人工智能企业合作,凸显数据到模型训练与产业应用环节的重要性。现有数据质量标准在产业场景有缺口,全国首部《人工智能训练数据集交付与质量验收规范》团体标准应运而生,现征集起草单位和专家。

AI大模型应用实践
新闻资讯7

全国首部AI智能体应用评估标准,现公开征集起草单位和个人!

2025年成AI智能体元年,市场规模将达113亿美元,但企业部署面临‘效能黑箱’。智合标准中心发起《企业级AI智能体应用效能评估规范》团体标准起草,填补评估空白,现公开征集起草单位和个人。

PaperAgent
新闻资讯7

全国首部AI智能体应用评估标准,现公开征集起草单位和个人!

2025年成AI智能体元年,市场规模将达113亿美元。但企业部署时面临‘效能黑箱’,缺乏评估规范。智合标准中心发起《企业级AI智能体应用效能评估规范》团体标准起草,现征集起草单位和个人。

AI工程化
新闻资讯7

全国首部AI智能体应用评估标准,现公开征集起草单位和个人!

AI智能体正从辅助向自主决策进化,但企业因缺乏评估规范,面临选型、验收、优化难题。智合标准中心发起《企业级AI智能体应用效能评估规范》团体标准起草,公开征集起草单位和个人。

开源星探
新闻资讯7

为AI智能体选型、验收、优化提供量化依据:首部评估标准公开征集中

AI智能体成2025年十大战略技术趋势之首,到2028年至少15%日常工作决策将由其自主做出。但企业面临信任鸿沟,缺乏评估规范。首部聚焦AI智能体应用的团体标准公开征集起草单位与起草人,适用于多方,有核心内容与价值。

PaperAgent
算法论文8

LLM越狱攻击的威胁被系统性高估? 基于分解式评分的「越狱评估新范式」出炉

目前LLM越狱攻击评估常依赖间接指标或LLM宏观判断,易有偏差。德国、中国等研究团队提出JADES框架,用分解式评分机制,揭示过去高估越狱攻击威胁,为评估建新标准。

机器之心
开源动态7

智能体安全如何保障?首个企业级AI Agent应用评估标准欢迎共同起草

近期OpenClaw走红,AI智能体从“能理解、能生成”走向“能执行、能协作”,但企业面临智能体上线条件判断难题。智合标准中心组织起草《企业级AI智能体应用效能评估规范》,现公开征集起草单位与起草人。

PaperAgent
开源动态8

告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25

埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。

新智元
算法论文8

仅100种子题,合成数据质量超GPT-5,阿里、上交提出Socratic-Zero框架

阿里巴巴与上交大联合提出 Socratic-Zero 框架,仅从 100 个种子问题出发,通过三智能体协同进化生成高质量课程。该框架合成数据质量超 GPT - 5 等,Solver 性能提升显著,工程友好,开启零数据自进化新路径。

机器之心
开源动态8

首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,ScienceBoard来了

ScienceBoard是首个面向科学任务、真实交互、自动评估的多模态智能体评测环境。它集成多领域科研软件,构建科研任务集合,评估智能体在科学任务上的表现,发现现有模型在科研工作流中远未成熟。

机器之心