大模型评测」共找到 9206 篇相关文章

新闻资讯7

Show me《指环王》!卡帕西强推大模型评测新基准

神卡帕西宣称Anthropic用《指环王》给大模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。

量子位
算法论文7

SOTA模型遇上加密数据评测:Qwen3未破10%,o1也栽了丨上海AI Lab等联合研究

当前推理模型在基准测试中性能卓越,但在密码学领域推理能力待探索。上海AI Lab等推出CipherBank评测,用海量真实隐私场景数据和多类型密码算法挑战SOTA模型,结果显示模型表现不佳,还分析了模型“犯难”原因。

量子位
新闻资讯8

王小川:医疗行业对模型有三刚性要求,但通用模型一条都不达标

5月22日百川智能展示医疗模型Baichuan - M4与AI家庭医生「百小医」。王小川指出通用模型用于医疗有问题,医疗对模型有低幻觉、强循证、会提问的刚性要求,而通用模型不达标。Baichuan - M4表现出色,百小医也有独特定位和优势,且与三家顶尖医院合作成果显著。

Founder Park
算法论文8

首个GUI多模态模型智能体可信评测框架+基准:MLA-Trust

MLA-Trust 是首个针对 GUI 环境下多模态模型智能体的可信度评测框架,构建了涵盖四核心维度的评估体系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。

机器之心
推荐文章7

模型 Token 究竟是啥:图解模型Token

文章详细解释模型Token概念,指出分词器会把文字切成Token,不同分词器切分结果不同。还介绍分词器的分词方法,通过统计文字出现频率打包成Token并编号,不同模型切分结果有差异。

机器学习AI算法工程
算法论文7

多模态模型理解物理工具吗?PhysToolBench提出了衡量多模态模型对物理工具理解的基准

香港科技学等团队提出 PhysToolBench,用于衡量多模态模型对物理工具的理解。它将理解分为三个等级,测试 32 个模型,揭示了模型在工具理解上的不足,也为未来发展指明方向。

机器之心
产品应用7

钉钉上跑出的第一个行业专属模型落地:准确率超 90% 的妇科专业模型

近日,壹生检康在钉钉企业专属 AI 平台训练出“豆蔻妇科模型”,准确率达 90.2%。钉钉构建支持体系助企业构建模型,后续还将帮伙伴构建模型和智能体,服务中小企业。

AI前线
算法论文8

ICLR 2026|多模态模型真的理解情绪吗?MME-Emotion给出了系统答案

多模态模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

机器之心
开源动态8

马斯克转发字节Seed&哥商学院新基准:模型搞金融,连查个股价都能出错

字节跳动Seed团队与哥商学院推出开源金融搜索与推理基准测试FinSearchComp,含635个问题。评测显示模型处理金融任务有差距,凸显金融AI能力评估重要性,还揭示了关键能力差距。

量子位
算法论文8

瘦身不降智!模型训推效率提升30%,京东模型开发计算研究登Nature旗下期刊

京东探索研究院模型研究登Nature旗下期刊。其提出系统与方法,经四创新使模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。

量子位