大模型测试」共找到 9649 篇相关文章

推荐文章7

快速理解热门LLM语言模型

本文用通俗易懂方式帮读者理解LLM、Transformer、Prompt等基本概念,介绍模型API使用,如温度参数、角色设定等,还提及Function Calling、Agent、MCP等内容,并对AI未来发展作出假想。

腾讯技术工程
算法论文8

团队直击模型高分神话:人类90分,最强模型仅49分

南京学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。

新智元
算法论文8

GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”

多模态模型在高分辨率、元素密集的 GUI 场景易误判。苏州学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。

深度学习自然语言处理
开源动态8

代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放

检索增强技术在代码及多模态场景作用,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。

机器之心
算法论文8

模型推理上限再突破:「自适应难易度蒸馏」超越R1蒸馏,长CoT语料质量飞升

本文从中兴通讯无线研究院「模型深潜」团队切入,介绍了首创的「LLM自适应题目难度蒸馏」方法,该方法围绕「模型 - 数据动态匹配」提出了一条完整的CoT构建流程,显著提升了长CoT语料的质量。

机器之心
算法论文8

NeurIPS2025 Spotlight | RobustMerge: 多模态模型高效微调模型合并的全新范式

中科院、中山学、北团队针对高效微调模型合并难题,提出「方向鲁棒性」概念,揭示 PEFT 模块合并失败主因,给出 RobustMerge 解决方案,提升性能,成果开源。

机器之心
开源动态8

多模态长文本理解测评首发:46款模型无一攻克128K难关

香港科等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。

量子位
推荐文章8

给非技术人的模型介绍:从零训练ChatGPT的全流程、天价成本及企业务实替代方案

文章介绍从零训练ChatGPT级别模型的全流程、高昂成本,指出这对多数企业不现实。建议企业战略从构建转向应用,通过租用API或微调开源模型利用模型,将专有数据视为核心资产。

AI Reading Hub
开源动态8

被 AI 厂逼至绝望,这帮欧洲人发起了一场“科学复兴运动”

AI前沿成果被科技巨头锁在“黑箱”,欧洲科学家、工程师等发起“科学复兴运动”成立LAION。他们构建开放数据集,训练出表现优异的模型,还进行“爱丽丝梦游仙境”研究测试模型,探讨推理模型发展方向。

AI科技大本营
算法论文8

模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026

阿里巴巴未来生活实验室团队解决多模态模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。

量子位