大模型评估」共找到 9354 篇相关文章

开源动态8

OPPO AI重磅发布:深度研究智能体,离“真正好用”还有多远?我们给模型做了一次全身体检

2025年,Deep Research成AI热点,OPPO AI Agent Team对模型评测。发布论文,开源评测基准FINDER和失败分类体系DEFT,揭示AI“装懂”“缺乏韧性”问题,还分析模型表现并给出发展建议。

深度学习自然语言处理
算法论文7

多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距

近年来,多模态模型在多种场景取得进展,但能否‘看懂图’存疑。西湖学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位
开源动态7

OpenAI解密模型失控:它不是变坏,而是「太听话」

OpenAI公开IH - Challenge,解决模型指令冲突难题。指出模型问题多因听信错误指令,给出系统>开发者>用户>工具的指令层级结构,设计数据集训练模型遵循高信任等级指令,提升安全可控性与抵御提示词注入能力。

新智元
开源动态8

全新OCR将图片变代码无损重绘!华中科&小红书发布3B模型,图形重建超越Gemini 3 Pro

华中科技学与小红书联合推出MOCR,提出「解析一切」新范式,将文档图形升级为「一等解析目标」。它解决传统OCR短板,在文档解析和图形重建表现出色,还革新评估方法,代码和模型已开源。

量子位
算法论文8

模型化身苏格拉底:通过主动提问挖掘人机协作的深度

微软与南加州学联合团队研究揭示激发模型主动提问能力新范式。通过定义主动信息收集任务、提出强化微调策略,经实验验证该方法有效,使模型在多领域表现出色,重新定义模型角色。

AIGC开放社区
算法论文8

定位模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆

此前学术界发现模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。

量子位
算法论文7

模型追逐星辰海,GPT和Gemini国际天文奥赛夺金

新论文以国际天文学和天体物理学奥林匹克竞赛 (IOAA) 为基准测试,证明 GPT - 5 和 Gemini 2.5 Pro 能在天文奥赛获金牌。研究还分析不同模型表现、与人类成绩对比及错误类型,强调需全面评估模型科研潜力。

机器之心
算法论文8

句子级溯源+生成式归因,C²-Cite重塑模型可信度

在人工智能发展背景下,模型内容可信度成焦点。北邮百家AI与小米团队提出溯源模型C² - Cite,首创上下文感知归因生成技术,解决现有归因模型缺陷,已被WSDM 2026收录。

机器之心
新闻资讯7

真实音频场景,模型集体挂科!首个原生语音基准MultiChallenge

Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三失败模式。

新智元
推荐文章8

【万字长文】模型训练推理和性能优化算法总结和实践

本文总结模型落地的训练、推理和性能优化算法与实践,介绍语言模型发展,对比BERT、GPT等训练方式,分析生成式模型问题,还阐述数据处理、推理优化及训练调优等内容,并给出不同场景技术选型建议。

阿里云开发者