大模型评估」共找到 9355 篇相关文章

新闻资讯8

中国团队首次在Nature子刊发布医疗AI标准,未来医生MedGPT摘得全球桂冠

中国AI医疗公司“未来医生”协同专家制定CSEDB,首次提出评估医疗模型临床能力的系统性框架,被《npj Digital Medicine》收录。在其评估下,未来医生的MedGPT在主流模型中夺冠。

量子位
开源动态8

全流程国产GPU,上下文提速100倍!中国科学院发布「线性复杂度」类脑模型

中国科学院自动化所李国齐、徐波团队发布国产自主可控类脑脉冲模型SpikingBrain-1.0,训练推理全用国产GPU。它具线性复杂度,超长序列处理速度快,还开源7B模型,为类脑智能发展提供新思路。

新智元
算法论文8

模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力

空间推理是多模态语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五任务验证其有效。

量子位
新闻资讯8

对话淘宝姜宇宁:如果你只推低价商品,是不需要用语言模型

淘宝姜宇宁团队上线RecGPT百亿参数推荐模型,对“猜你喜欢”功能技术升级。模型赋予传统推荐系统新能力,如让其“白盒化”、理解长上下文等。姜宇宁认为AI要创造商业价值,落到业务场景形成正向循环。

AI科技评论
新闻资讯7

性能翻番背后:讯飞与昇腾,如何用国产算力炼就模型?|甲子光年

在全球AI竞争激烈背景下,科讯飞与华为昇腾深度合作意义重。双方合作历经四阶段,实现性能提升与技术突破,还通过软硬件协同构建AI自主发展竞争力,加速模型行业落地。

甲子光年
算法论文8

EMNLP2025 | 解耦视觉与推理,港探索视觉语言模型"眼智分离"新范式

当前视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。

深度学习自然语言处理
算法论文8

直接从像素到单词:这个原生模型统一单图、多图、视频和空间智能

南洋理工学等团队推出NEO - ov模型,挑战传统「视觉编码器 + 模型」范式,直接从原始像素学语言。它在多任务表现出色,尤其空间智能突出,但在OCR等方面有短板,展现原生多模态建模潜力。

机器之心
算法论文7

Google 新论文离谱到家了,0延迟0成本通用,提升模型准确率最简单的方法。

Google新论文提出简单提升模型准确率的方法,即重复提示词,把完全一致的输入连续发2次。主流模型适用,经70项benchmark测试,0场景效果倒退,47个场景准确率提升,且几乎不增延迟、成本。

探索AGI
新闻资讯7

模型全员0分!谢赛宁领衔华人团队,最新编程竞赛基准出炉,题目每日更新禁止刷题

谢赛宁等人出题,让o3、Gemini - 2.5 - pro等模型全军覆没。LiveCodeBench Pro是实时基准测试,题库每日更新。此前称LLM编程超人类专家,本次测试并非如此,最好模型难题通过率也为0。

量子位
新闻资讯7

究竟会花落谁家?DeepSeek最新模型瞄准了下一代国产AI芯片

近期,DeepSeek发布V3.1新模型,采用全新混合推理架构,在多任务表现上有提升。它采用UE8M0 FP8,或为国产推理芯片优化机制。国内多家厂商新一代AI芯片支持FP8,未来国产模型或针对其专门优化。

机器之心