质量评估」共找到 1290 篇相关文章

推荐文章7

揭秘大模型评测:如何用“说明书”式方法实现业务场景下的精准评估

文章系统性介绍业务场景下大模型评测流程,包括需求分析、评测集设计生成、维度设定、任务执行和报告输出。指出评测挑战,如设计维度和集,还给出评测方法及案例,像蚂蚁评测集、业务自动化评测。

阿里云开发者
开源动态8

智源研究院发布中英文高质量数据集CCI4.0,推动全球人工智能开源创新

2025年5月6日,智源研究院在全球开源创新论坛发布中英文高质量数据集CCI 4.0,同步在多平台开源。CCI 4.0规模大,处理严格,此前CCI系列反响好,未来将持续建设中文预训练语料库。

AI科技大本营
算法论文8

突破长视频生成瓶颈:南大、TeleAI推出全新AI生成范式MMPL,让创意一镜到底

当前AI长视频生成面临质量骤降、细节崩坏、生成低效等问题。南京大学联合TeleAI推出MMPL新范式,首创“宏观规划、微观执行”双层生成架构,实现分钟级高质量长视频稳定生成,效率显著提升。

机器之心
开源动态8

真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击

上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。

机器之心
算法论文8

一文读懂深度表格数据表示学习 | 南京大学

南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。

量子位
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。

CourseAI
算法论文8

HaluMem:让AI记忆系统的“幻觉”现形——首个面向记忆系统的操作级幻觉评测基准

过去一年,AI Agent的‘记忆能力’成热门话题,但AI记忆存在幻觉问题。为此发布操作级幻觉评估基准HaluMem,它能精准定位幻觉来源,评估主流记忆系统,为构建可靠记忆系统提供方向。

PaperAgent
产品应用8

Claude悄悄更新了Skills生成器,这绝对是一次史诗级升级。

Anthropic的Claude悄悄更新了Skills生成器Skill - creator,此次是史诗级升级,新增评估系统、基准测试、多代理并行测试、描述调优等4个全新能力,还演示了其使用方法和效果,建议更新并优化评估所有Skills。

数字生命卡兹克
开源动态7

GPT-5得分不到0.4!法律+金融最大规模基准:1.9万+专家评估准则

新推出的PRBench基准可测AI在金融和法律领域表现。它有19356条专家评估准则,是该领域最大公开基准。顶尖大模型在困难子集得分低,还独创经济路径分析维度,约30%任务为多轮对话,揭示了AI在专业领域的不足。

新智元