大模型测试」共找到 9630 篇相关文章

算法论文8

西工张伟伟团队:模型时代航空科技的蓝图畅想 | 航空学报CJA

随着国产开源模型涌现,语言模型走入生活,挑战传统航空教育,革新科研范式,与航空产业融合推动变革。西工张伟伟团队探讨其在航空工程教育、科研、行业全链条的影响及挑战。

力学与人工智能
产品应用7

我让10个模型又参加了完整版数学高考,第一名居然是它。。。

作者让10个模型参加完整版数学高考,单独制定规则,邀朋友协助测试。结果令人意外,单选题第6题成噩梦,多模态题模型几乎全军覆没。讯飞星火和豆包145分并列第一,Qwen3屈居第三。

数字生命卡兹克
开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
算法论文8

模型上车:理想汽车硬件协同设计算出最佳边缘模型

长三角洲AI实验室、中科院、理想汽车等找到语言模型硬件协同设计寻优之路,在相同延迟下降低端侧模型困惑度,压缩模型架构挑选时间。研究揭示缩放定律,打造硬件感知建模框架,找到精度与延迟最优解。

AIGC开放社区
开源动态8

微软开源2025 ICML获奖框架,终结模型多轮对话严重缺陷

微软开源2025年ICML获奖框架CoLLabLLM,可解决模型多轮对话缺陷。它由四模块构成,经多轮对话模拟和奖励优化模型。在三基准平台测试显示,能在多样任务中高效协作。

AIGC开放社区
新闻资讯7

让GPT-4.1「头皮发麻的考试」!OpenAI给模型上强度,AI能赢吗?

OpenAI 公布 MRCR 评测标准数据集,其针对 AI 模型上下文能力进行「奥运会」级别测评。MRCR 提升了测试难度,能揭示 AI 能力边界,推动模型发展,帮助更合理应用技术。GPT4.1 在一些测试中表现出色,未来 AI 能力上限充满可能。

新智元
算法论文8

模型多模态检索全面超越SOTA!ReCALL框架化解生成式与判别式的范式冲突|CVPR'26

紫东太初团队联合新加坡国立学攻克模型检索难题,其ReCALL框架以‘诊断 - 生成 - 校准’闭环体系解决范式冲突,让模型变身高效检索器,成果被CVPR 2026录用,刷新SOTA性能。

量子位
开源动态8

Meta 新成立超级智能实验室,让模型RAG推理速度飙升30倍

Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在多任务测试中表现出色,为模型部署提供实用方案。

AIGC开放社区
推荐文章7

本地LLM万字救场指南来了!全网超全AI实测:4卡狂飙70B模型

文章围绕本地语言模型(LLM)展开,针对实用性和经济性问题,用Dell Precision 7960塔式工作站对主流模型测试。涉及不同尺寸模型、推理框架等,给出不同配置下性能指标及使用建议,还模拟真实场景测试

新智元
算法论文8

模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026

复旦、创智联合推出RSAgent,让多模态模型通过多轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在多个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。

量子位