多视角评估」共找到 4735 篇相关文章

开源动态8

o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:图空间智能试金石

文章介绍了MMSI - Bench,这是用于评估MLLM图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用样真实数据。实验显示MLLM在图像空间推理有短板,还开发自动化错误分析流程助力改进。

量子位
算法论文7

CodeClash 通过轮编程竞赛对大型语言模型进行基准测试

评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让个 LLM 在轮比赛中较量,涉及种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。

InfoQ
算法论文8

GraphRAG圈新秀:文档级RAKG

随着大模型能力增强,知识图谱成研究热点。传统KGC有实体消歧难、模式僵化等痛点。文章提出RAKG框架,将RAG评估机制引入知识图谱构建,实现文档级自动化构建与评估指标表现优异。

PaperAgent
算法论文8

准确率腰斩!大模型视觉能力一出日常生活就「失灵」

EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。

量子位
算法论文8

密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25

清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了个热门模型,发现它们在推理和探索行为方面存在诸问题。

量子位
新闻资讯7

CVPR2025 | 模态LLM评测Tutorial

模态大语言模型(MLLMs)研究热门,有效评估成关注焦点。CVPR2025将举办模态LLM评测Tutorial,梳理评估基准,探讨评估方法,聚焦‘幻觉现象’,团队经验丰富,覆盖板块内容。

深度学习自然语言处理
算法论文8

OpenAI、Anthropic、DeepMind联手发文:现有LLM安全防御不堪一击

OpenAI、Anthropic、Google DeepMind 联手发文,研究语言模型安全防御评估。指出现有防御评估有缺陷,提出通用自适应攻击框架,成功绕过 12 种防御机制,数攻击成功率超 90%。

机器之心
算法论文8

给定"标价"的 LLM 智能体,能规划出"最优"路径吗?

在LLM智能体轮工具使用中,评估成本是难题。来自所高校的团队推出CostBench基准,围绕旅行规划构建评估环境。评估顶尖模型发现其规划与适应能力有短板,并分析失效根源,还指出下一代智能体演进方向。

深度学习自然语言处理
算法论文8

大语言模型逻辑评估

现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在数据集测试款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。

深度学习自然语言处理
推荐文章7

别再构建智能体了

Multi Agent应用有望成大模型应用范式,但Cognition AI团队认为2025年追求智能体并行协作架构是歧途,存在信息孤岛和决策冲突问题。主张采用单线程线性架构与上下文工程。

AI工程化