「多模态语言推理」共找到 3446 篇相关文章
MoCa:首个大规模双向多模态表征模型
为解决VLM用于嵌入的痛点,中国人民大学等机构研究者提出MoCa框架,可将单向注意力VLM训练成双向多模态编码器。它分两阶段,实验效果好,未来可拓展模态、提升多语言适应等。
ICML 2026 | 北大提出的APEIRIA,打破了3D MLLM黑盒推理困境
北大团队提出面向3D空间推理的新框架APEIRIA,将神经符号程序推理模式蒸馏进3D MLLM。采用三阶段课程学习,在多基准测试表现强劲,保留模块化优势,为具身智能系统提供启发。
大模型推理加速全链路:内存管理、编译优化、量化与并行策略
本文整理自金煜阳博士在QCon大会分享。介绍大模型推理挑战,如规模增大、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。
豆包悄悄上线的这个新功能,也能用眼睛推理全世界了。
作者分享豆包新上线的视觉推理功能,在PC和手机场景使用体验良好。通过ChinaJoy图片、德爷相关图片、表情包等实例展示其推理能力,虽有软肋但很实用,还免费,体现出与其他工具的差距。
英伟达力荐,小团队两个月开源一款「光速级」智能体推理引擎
智能体时代算力需求庞大,LightSeek Foundation 小团队 2 个月打造大模型推理引擎 TokenSpeed,有 TensorRT LLM 性能、vLLM 易用性,受英伟达力荐且已开源,为智能体负载提供近「光速级」推理能力。
单机H200最快DeepSeek V3和R1推理系统优化秘籍
作者从开源技术分享角度,盘点SGLang对单机规模推理的大量工程优化技巧,涉及FP8 Block GEMM演进、FusedMoE模块优化、Attention Backend优化等,助于提升DeepSeek V3/R1在单机H200上的推理性能。
PD 分离推理的加速大招,百度智能云网络基础设施和通信组件的优化实践
为适应PD分离式推理部署架构,百度智能云从物理网络、网络流量、通信组件和算子层面优化,提升上层推理服务性能,展现了网络、组件与业务特征融合的重要性。
阿里:RL强化LLM推理,是技巧还是陷阱?
近年来,强化学习(RL)成为解锁大型语言模型(LLM)复杂推理能力的关键工具,但该领域也面临技术选择困境。阿里联合多所高校的论文通过大规模可复现实验,揭示主流RL技巧的机制与适用场景,还发现极简组合(Lite PPO)性能超越复杂方案。
这样更公平:用jina-reranker-m0为多模态文档打分重排
文章指出多模态搜索领域给文档综合评分难,因文本与图像评分缺乏可比性。2025年4月发布的jina - reranker - m0可解决此问题,其两阶段检索流程能显著提升召回率,对多模态AI系统设计有启发。
谷歌新发现:DeepSeek推理分裂出多重人格,左右脑互搏越来越聪明
谷歌研究表明,DeepSeek - R1等顶尖推理模型解题时,内部会自发“分裂”出不同性格虚拟人格,像在进行社交、辩论会,且越“吵”越聪明。团队借助SAE解码其脑内群聊,还发现‘哦!’能提升推理准确率。