「多图像空间推理」共找到 2768 篇相关文章
DeepSeek倒逼vLLM升级!芯片内卷、MoE横扫千模,vLLM核心维护者独家回应:如何凭PyTorch坐稳推理“铁王座”
本文介绍了vLLM的发展,自开源后成科技公司首选推理引擎。因DeepSeek发布,团队转向其模型特性优化;还参与各芯片支持工作。vLLM靠PyTorch支持多硬件,同时拓展到多模态推理,面临竞争仍保持优势。
抢天才还是拼算力?前 Llama 推理负责人详解 AI 的真实天花板
前 Llama 推理负责人 Ross Taylor 在播客访谈中指出,AI 竞赛中的混乱和挖角是噪声,最终会被指数级算力淹没。他阐释了算力指数曲线决定竞赛天花板,强调系统性实验、高质量评估的重要性。
人大高瓴赵鑫团队新作:先拆掉 RLVR,再重建推理模型训练
人大高瓴赵鑫团队围绕RLVR框架做系统实验,完成论文《A3PO: Adaptive Asymmetric Advantage Shaping for Reasoning Models》,提出A3PO方法。该方法将训练重点转向关键决策点,让推理模型学习更可控。
大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力
空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。
先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?
多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。
EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智分离"新范式
当前大视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。
上海交大DENG Lab提出「LatentUM」:Unified Model的真正「战场」在视觉推理与世界模型
上海交通大学 DENG Lab 提出的 LatentUM,尝试让统一模型把生成的视觉内容纳入推理闭环。它在多项任务上超越基线,其核心思路是生成与语言共享语义空间的离散 visual semantic tokens,模型含三大关键设计。
GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”
智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。
不堆参数堆架构,这个8B开源模型把图像理解和生成统一了
商汤开源全新架构的理解生成统一模型SenseNova-U1,虽小尺寸版仅8B参数,却能复刻GPT - Image - 2的不少绝活,在多项指标上登顶开源模型榜首,推理速度逼近主流商用闭源模型。它具备连续性图文创作等能力,底层是NEO - unify架构。
AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠
合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过多层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。