推理评测」共找到 2550 篇相关文章

算法论文8

全球顶尖AI做物理,被人类按地摩擦?不懂推理大翻车,本科生碾压

港大等机构用3000道物理题测试顶尖大模型,如GPT - 4o、Claude 3.7 Sonnet等,结果模型准确率远低于人类专家。研究推出PHYX基准测试,揭示模型依赖知识、公式和模式匹配,缺乏真正物理理解。

新智元
产品应用7

揭秘与评测 30K+ Star 的 Graphify:企业存量系统 AI 编码的"第二大脑"。

文章揭秘评测 30K+ Star 的 Graphify,它能将分散材料转为结构化知识图谱,助 AI 编程助手理解代码。介绍其使用方法、原理,经测试它能提升综合质量、降低探索成本,不过并非万能解药。

AI大模型应用实践
8

刚刚,OpenAI神秘新模型斩获IMO 2025金牌!攻克奥数巅峰,硅谷沸腾

OpenAI用全新通用推理模型夺下IMO 2025金牌,解出5道题狂揽35分,远超此前Gemini 2.5 Pro的13分。此或意味着其研发出颠覆性推理技术,告别CoT,且模型未针对IMO训练,有持久创造性思维。

新智元
开源动态8

给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集

随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。

机器之心
算法论文8

经验记忆黑科技:LightSearcher让AI工具调用减39.6%、推理快48.6%

现有的 RL 驱动的深度思考大模型系统面临准确率与效率的「跷跷板」困境,北邮百家 AI 团队提出 LightSearcher 框架,解决了这一痛点,在保持准确率的同时,显著提升了工具调用效率。

机器之心
算法论文8

EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智分离"新范式

当前大视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。

深度学习自然语言处理
开源动态8

10项评测痛打GPT-4o!智源重磅开源全球最强具身智能大脑

近日,智源研究院开源具身大脑RoboBrain 2.0 32B版本和跨本体大小脑协同框架RoboOS 2.0单机版。RoboBrain 2.0在多项权威具身智能基准上刷新纪录,RoboOS 2.0创新性集成MCP协议与无服务器架构,二者双擎联动推动机器人迈向群体智能。

新智元
算法论文8

让RAG告别断章取义,HiChunk做到了~

现有RAG评测忽视文档切分,腾讯优图提出HiCBench评测基准和HiChunk框架。HiCBench含人工标注多级切分点与证据稠密QA,HiChunk用微调LLM建多级语义树,配Auto - Merge算法,实验效果佳。

PaperAgent
开源动态7

110万美元悬赏!AMD发起全球战书:谁能打破DeepSeek与Kimi的推理速度极限?

AMD与GPU MODE联合发起2026线上黑客松,向全球发榜。挑战赛设110万美元奖池,分预选赛和决赛,要对核心GPU算子打磨、挑战明星模型,代码须可合并,给出了赛程安排及参赛方式。

AI科技大本营
算法论文8

多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降

多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。

新智元