大模型评测」共找到 9208 篇相关文章

推荐文章7

特征工程、模型结构、AIGC——模型在推荐系统中的3落地方向|文末赠书

文章指出模型在三个层次改变推荐系统,一是改变“知识学习”方式,带来知识输入革命;二是改变“智能体”结构,探索推荐模型新范式;三是创造“新世界”,实现个性化内容生成。还介绍了相应落地应用及对从业者的建议。

AI前线
新闻资讯8

真正面向模型的AI Infra,必须同时懂模型、系统、产业|商汤装置宣善明@MEET2026

商汤装置副总裁宣善明在MEET2026会分享进展,强调模型时代AI Infra要解决算力高效支撑问题。商汤战略“1+X”,装置有优势,算电协同成果好,还推动国产化适配,产业落地成果多。

量子位
新闻资讯7

真实音频场景,模型集体挂科!首个原生语音基准MultiChallenge

Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三失败模式。

新智元
算法论文8

模型转行土木工程!首个「打灰人」评估基准:检验读、改工程图纸能力

首个工程自动化任务评估基准DrafterBench,可测试模型在土木工程图纸修改任务中的表现。它模拟真实工程命令,考察模型四方面能力。评测发现主流模型有一定能力,但未达工程一线要求。

新智元
开源动态8

从多模态模型中「拆」出音频向量模型

Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。

Jina AI
算法论文8

面对无解问题模型竟会崩溃?港中文&华为联合提出首个模型推理可靠性评估基准

港中文和华为诺亚实验室联合提出ReliableMath基准,探究模型推理可靠性。提出评估准则,构建含可解与不可解问题的ReliableMath数据集,实验揭示模型缺陷,还提出提高可靠性的对齐策略。

机器之心
开源动态8

里程碑!逻辑智能发布全球首个完全开源语音模型框架LLaSO,语音AI迎来新纪元

逻辑智能发布全球首个完全开源语音模型框架LLaSO,它像“全家桶”,提供高质量数据、统一评测基准和强基础模型。语音模型发展遇瓶颈,LLaSO框架及参考模型LLaSO - Base有望打破僵局。

AI科技评论
算法论文8

知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳

东南学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。

量子位
算法论文8

别被室内基准高分骗了:模型是在推理空间,还是在「背答案」?

2025年,空间智能成模型竞争新热点,模型在室内基准上分数飙升。但因训练与测试数据同源,其提升或只是“背答案”。中科院学等机构发布OSI - Bench重新审视模型空间能力,评测显示当前提升可能是虚假繁荣。

机器之心
开源动态8

模型理解真实医疗视频,全球首个开源技术方案来了!

AI 进入医疗领域需谨慎,此前美国引入不成熟 AI 致手术失误频发。全球首个医疗视频理解模型元智医疗视频理解模型发布并开源,解决了医疗视频领域的任务优化、数据缺失和无法评测痛点。

机器之心