大模型评测」共找到 9216 篇相关文章

新闻资讯7

先验+后验加持,模型能否 hold 住推理预测的现实「溢出」?

多数模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,模型在现实场景运用仍待优化。

机器之心
开源动态7

一文彻底搞懂 MCP:AI 模型的标准化工具箱

MCP(模型上下文协议)是 Anthropic 于 2024 年 11 月开源的新技术,是 AI 模型的标准化工具箱。它能让模型与外界互动、获取信息、完成任务,整合 Function Call 标准,几乎所有模型都可接入。

机器学习AI算法工程
算法论文8

模型也需要自我反思,上海AI Lab合成“错题本”让模型数学成绩提升13.3%

上海AI Lab提出LEMMA方法,构建“错误 - 反思 - 修正”数据,让模型从错误中学习。通过教师模型定向制造“学生会犯的错”构造数据,实验显示在Llama3 - 8B上数学解题准确率提升13.3%。

量子位
开源动态8

鹏城实验室 X 中hcp实验室推出 RADAR : 具身智能评测的新标杆

RADAR是鹏城实验室与中hcp实验室为具身智能领域设计的评测基准,解决现有评测体系三缺陷,通过创新设计揭示模型不足,为研究者提供方向,推动具身智能实用化。

AI科技评论
算法论文8

模型时代,通用视觉模型将何去何从?

过去通用视觉模型(VGM)是研究热点,想实现‘视觉模型一统’。但语言模型发展使研究热点转移,视觉‘独立性’被重新定义。清华鲁继文团队综述梳理其进展,探讨现状、挑战与应用潜力。

机器之心
算法论文8

模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!

随着语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力。

深度学习自然语言处理
推荐文章7

智能投顾的模型应用,为什么选择了“模型协同”?

模型时代,金融智能投顾落地是技术与业务安全的双重挑战。北银金科高级算法专家尹辰轩表示采用“模型协同”架构,能在性能、准确性与合规间找平衡,还阐述了架构亮点、问题解决办法等。

InfoQ
开源动态8

蚂蚁·安诊儿医疗模型:正式开源并登顶权威医疗榜单

近日,蚂蚁集团联合浙江省卫生健康委开源自研的蚂蚁·安诊儿医疗模型。它基于蚂蚁百灵模型架构,经深度训练,是参数规模最的开源医疗模型。该模型在多评测中表现出色,有三阶段训练流程,架构高效、推理快,已开源助力行业发展。

新智元
算法论文8

只需一次指令微调,模型变身全能专家天团,8B模型性能反超全微调基线 | ACL25 Oral

预训练模型适应专业领域需高昂微调成本,稀疏混合专家架构虽能提升推理效率,但从头训练耗资源。浙与Thomson Reuters团队提出SIMoE,单阶段微调就能升级模型,还解决传统方法两局限,在性能和效率上双突破。

量子位
新闻资讯8

从 CIPS & CLM 迈进:中国模型的智能跃迁

中国中文信息学会2025学术年会暨第二届中国模型会(CIPS & CLM 2025)于10月28日在北京召开,众多专家学者参会。会聚焦模型多方面内容,发布“模型基金”,举办多场报告与论坛,展现中国AI领域进展。

AI科技评论