推理数据」共找到 4178 篇相关文章

推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。

CourseAI
新闻资讯7

苹果拆解AI大脑,推理模型全是「装」的?Bengio兄弟合著

苹果最新研究揭示大推理模型(LRM)在高复杂度任务中普遍‘推理崩溃’。即便给予明确算法提示,模型亦无法稳定执行,暴露推理机制的局限性。研究还通过多种实验环境分析了模型在不同复杂度问题中的表现。

新智元
开源动态8

32B 稠密模型推理能力超越 R1?中国秘密 AI 团队发布推理小模型 AM-Thinking-v1

2025年,国内神秘A - M - team在Hugging Face开源32B推理模型AM - Thinking - v1。它在多推理评测中击败DeepSeek - R1,与超大规模模型成绩相当。团队靠后训练方案挖掘32B模型潜力,探索小体量实现大能力路径。

AI科技评论
算法论文8

ICLR 2026 | 别再让大模型“想太多”了!最新研究揭示 LLM 推理效率的关键瓶颈

大语言模型推理计算成本失控,存在过度与思考不足问题。研究揭示推理失衡是根源,提出BAM模型及Plan - and - Budget框架,实验显示其能提升准确率与效率,转向‘推理价值’范式。

机器之心
算法论文7

多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品

现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。

量子位
算法论文8

1052篇文献!上海AI Lab发布科学LLM综述:从数据基础到Agent前沿

上海AI Lab主导,25家研究机构共同梳理270+训练集、190+评测集,提出科学数据分层框架与智能体闭环科研新范式。还介绍了模型演进、数据情况、评估基准等,指出数据缺陷并展望走向科学家智能体的三步。

PaperAgent
产品应用8

英伟达帮你省钱,让大模型推理「短而精」,速度快5倍

过去大模型推理追求长链思维,导致推理链长、Token消耗大、响应慢。英伟达研究院的DLER研究给出解决办法,通过强化学习优化方法让模型‘短而精’,推理长度减超70%且准确率不变,还适用于大模型。

机器之心
新闻资讯8

两张图定位全球,o3碾压T0级高手!人类「诡计」被看穿,跨模态推理爆表

OpenAI的o3在GeoGuessr游戏中与大师级玩家Sam Patterson对决,o3通过视觉与搜索推理,忽略伪造EXIF信息,最终以23179比22054获胜,展现出跨模态推理潜力,引发对AI推理能力的思考。

新智元
算法论文8

NIPS 2025 Spotlight | 港大提出TreeSynth方法,一句话生成百万规模数据

港大团队提出TreeSynth方法,受决策树启发,将数据合成问题映射到其空间分割机制。它采用两阶段流程,能从零合成数据,还可优化现有数据集。实验显示其在多基准任务上性能提升显著,可扩展性佳。

机器之心
开源动态8

中国具身模型狂揽全球第一!机器人的人类数据时代来了

00后带队的灵初智能用近10万小时人类数据拆解具身智能,1000小时数据开源。其发布Psi-R2和Psi-W0双系统架构,让Psi-R2登顶MolmoSpace榜单。灵初认为纯人类数据训练必要,还强调开源对具身智能落地重要。

量子位