「多模态训练」共找到 2827 篇相关文章
OpenAI华人AI大牛集体跳槽Meta!清华北大浙大中科大校友各一位,多模态后训练、感知团队负责人全走了
扎克伯格从奥特曼手里挖走4名OpenAI华人顶尖AI人才,包括中科大、浙大、清华、北大校友各一位。OpenAI或提高薪酬留人,人才争夺战成本升高,这也是开源与闭源阵营的交锋。
英伟达&MIT等推出Long-RL,长视频训练速度翻倍
英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。
北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
北大王选所彭宇新团队在论文中提出TARA方法,引入生物分类学知识与多模态模型中间表征对齐。实验显示,TARA能提升模型层级识别和未知类别识别能力,还可加速训练收敛,计算开销小。
细粒度视觉推理链引入数学领域,准确率暴涨32%,港中文MMLab打破多模态数学推理瓶颈
香港中文大学MMLab团队发布MINT - CoT视觉推理方案,解决多模态数学推理难题。它引入特殊Interleave Token,构建专属数据集,采用三阶段训练策略,实验效果全面超越现有方法。
Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana
北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。
智谱终于发布GLM-4.5技术报告,从预训练到后训练,细节大公开
上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练到后训练细节,还介绍了开源 RL 框架 slime,展示模型架构、训练阶段等,评估了在多任务上的表现。
打破「数据暴力」预训练惯性,阿里Qwen、上交大等提出预训练动态数据选择范式OPUS
阿里Qwen、上交大等团队提出预训练动态数据选择范式OPUS,打破“数据暴力”预训练惯性。它将数据选择与优化器更新轨迹对齐,提升预训练效率与下游泛化表现,实验显示其“效率+性能”双提升。
谢赛宁等推出统一多模态模型!替代VAE实现图像理解/生成双SOTA,代码权重数据集全开源
谢赛宁等团队推出统一多模态模型Blip3 - o,用扩散Transformer生成CLIP图像特征,采用顺序预训练策略。对比多种设计方案,确定CLIP + Flow Matching最佳,模型在多任务测试表现卓越且全开源。
小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度
小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。
超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型
现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。