多模态Scaling范式」共找到 1976 篇相关文章

算法论文8

突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO

先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。

机器之心
产品应用7

FairyGen:AI 把孩子的画“动”起来,个性化教育和动画创作

FairyGen 能将孩子画作变成卡通短片,通过多模态大语言模型构思分镜脚本,采用分层建模处理前景人物动作与背景动态。其生成流程分四阶段,但也存在前景角色重建不准、背景生成不稳定等问题。

带你学AI
算法论文8

Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转

Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。

机器之心
开源动态8

OpenAI未公开的o3「用图思考」技术,被小红书、西安交大尝试实现了

OpenAI推出的o3推理模型打破传统文字思维链边界,实现图像融入推理过程。小红书与西安交大联合构建多模态深度思考模型DeepEyes,尝试实现类似能力,还开源技术细节,在多任务中表现出色。

机器之心
算法论文8

让大模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026

复旦、创智联合推出RSAgent,让多模态大模型通过多轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在多个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。

量子位
新闻资讯8

DeepMind发布SIMA 2!打通「感知-推理-行动-反思」闭环

DeepMind推出的SIMA 2,可让智能体在虚拟环境中边聊天边进行复杂多模态推理。它整合Gemini能力,从指令执行者变为互动伙伴,有强大迁移泛化与自我提升能力,是迈向AGI重要一步,但也面临一些挑战。

新智元
新闻资讯7

具身智能机器人年度总结,来自英伟达机器人主管

英伟达机器人主管Jim Fan在2025年末判断机器人领域仍处蛮荒时代。他指出该领域缺乏统一评测体系,硬件进展快但可靠性不足限制软件迭代,VLM→VLA技术范式有问题,还分享了数据、模型等方面情况。

量子位
新闻资讯8

英伟达:RLP 让 AI 在预训练时就学会思考

英伟达研究团队发布 RLP 技术,与传统大语言模型训练不同,它在预训练阶段就让模型学会'先想后说'。通过奖励机制自我监督,实验效果惊人,性能提升显著,不挑数据,打破了大模型训练范式

AI工程化
开源动态8

社区供稿丨MiniCPM-V 4.5 技术报告正式出炉

上个月开源的多模态模型 MiniCPM-V 4.5 广受好评,今日其技术报告出炉。报告从架构、数据和训练三方面探索高效路径,提出三大技术,使模型在多任务上突破,小参数规模下性能和推理速度佳。

Hugging Face
开源动态7

一夜之间,Claude Code删掉了80%系统提示词

本周五,Anthropic 技术团队成员 Thariq Shihipar 介绍新一代大语言模型工程趋势变化。Anthropic 发现旧提示词工程范式在新一代强推理模型发布后或过时,新的 Claude.md 应精简,大砍系统提示词后可把特定任务上下文交给 Skill。

机器之心