多模态大模型」共找到 9309 篇相关文章

算法论文8

抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅

视觉推理任务中,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 在推理中实时生成、执行并迭代 Python 工具,在多类任务中显著提升性能,实现范式跃迁。

深度学习自然语言处理
算法论文8

全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案

随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力。

机器之心
开源动态8

社区供稿丨MiniCPM-V 4.5 技术报告正式出炉

上个月开源的多模态模型 MiniCPM-V 4.5 广受好评,今日其技术报告出炉。报告从架构、数据和训练三方面探索高效路径,提出三技术,使模型在多任务上突破,小参数规模下性能和推理速度佳。

Hugging Face
算法论文8

强化学习新发现:无需数学样本,仅游戏训练AI推理

莱斯学、约翰斯・霍普金斯学和英伟达研究团队有颠覆性发现,让多模态语言模型玩简单游戏,无需数学样本,就能显著提升其多模态推理能力。提出的ViGaL方法在多个基准测试中表现出色。

机器之心
产品应用8

不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?

文章指出企业训练多模态助手,30B 参数的开源多模态模型如 Qwen-VL-30B 是不错选择,但多模态场景下显存需求。联想 ThinkStation PGX 解决了显存难题,还介绍其性能、优势、适用场景及服务等。

机器之心
算法论文8

ICLR 2026 Oral|模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升

以DeepSeek - R1等为代表的型推理模型存在过度思考问题,造成量冗余计算。复旦学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。

机器之心
算法论文8

无需训练,直接「算出」最强AI!理想汽车发现端侧Scaling Law

理想汽车基座模型MindVLA团队与国创决策智能技术研究所联合发布论文,提出面向端侧语言模型的「硬件协同设计扩展定律」,解决模型部署在端侧设备的难题,实现软硬协同设计,提升模型性能和研发效率。

新智元
产品应用8

从操作系统到Agent Team,字节Seed 2.0来了!

作者受字节内测邀请,对豆包模型Seed 2.0进行多方面测试。在APP开发、多模态理解、操作系统构建、Skills调用、真实项目开发等测试中表现出色,虽有小缺点,但整体提升,值得试用。

AI产品黄叔
产品应用8

上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”

上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。

OpenMMLab
产品应用8

Seedance 2.0刷屏后,字节还有个硬核模型——3个复杂任务实测Seed 2.0

作者作为AI编程工具深度用户,没追热门的Seedance 2.0,而是实测同期发布的豆包模型Seed 2.0。设计3个日常复杂任务,在TRAE接入其Pro版测试,展现出强的自主纠错和多任务处理能力,也指出了不足。

花叔