「多模态数学推理」共找到 2913 篇相关文章
《多模态大语言模型技术发展报告》正式发布 | 中科算网算泥社区
2月5日,中科算网算泥社区发布《多模态大语言模型技术发展报告》。报告回顾多模态大模型发展历程,剖析核心技术创新,展示应用实践,分析挑战与机遇,为各界提供参考,推动多模态AI技术发展。
「百万级」视频推理数据集!30+顶尖高校联合发布
AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。
多模态开发革命!Gabber开源:图形化构建实时AI应用,效率提升10倍!
AI应用迈向多模态交互,传统开发方式周期长。开源项目Gabber是实时AI应用引擎,通过模块化与图形化简化开发,有诸多特性,还给出安装指南,适用于多种场景。
ICLR 2026|UIUC:一行代码彻底解决LLM推理的过度思考!
2025年DeepSeek发布推理大模型,引发RLVR研究热潮,但该方法有“过度思考”问题。伊利诺伊大学香槟分校等研究者提出Self - Aligned Reward(SAR),能提升推理准确度和效率,有望推动大模型推理系统发展。
OpenAI自曝:AI推理砸钱越多,碾压人类越狠!
OpenAI研究员探讨推理模型时代。Noam Brown强调预训练和推理范式,指出当前AI胜在通用性。推理范式成本低、效果好,如o系列模型表现出色。首席经济学家谈AI经济影响,称其重塑企业格局。
DeepSeek推理最高提速6倍!开源研究:加装「思维进度条」,计算量减少30%
特拉维夫大学团队开发新方法,给LLM推理任务装进度条,控制推理深度和速度。提出“思维进度向量”TPV预测推理位置,干预TPV可“超频”“降频”,模型已在GitHub开源。
谷歌之后,英伟达入局扩散大语言模型,Fast-dLLM推理速度狂飙27.6倍
大语言模型领域,推理效率制约实际应用。谷歌Gemini diffusion曾展扩散模型并行潜力,但开源扩散LLM推理慢。近日,NVIDIA等推出Fast - dLLM,无需训练即插即用,推理速度狂飙27.6倍,兼顾速度与精度。
别再无脑开高推理!Opus 5高配会擅自重构代码乱加戏
有人用FrontierCode编程基准测试Opus 5推理档位,发现性能顶峰在medium档,高档位推理预算多余,会让模型反复校验、偏离需求,在代码场景还会擅自重构代码。Anthropic也建议调低推理档位。
定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%
谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。
揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路
上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。