多模态知识获取」共找到 1505 篇相关文章

算法论文8

突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO

先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。

机器之心
产品应用7

FairyGen:AI 把孩子的画“动”起来,个性化教育和动画创作

FairyGen 能将孩子画作变成卡通短片,通过多模态大语言模型构思分镜脚本,采用分层建模处理前景人物动作与背景动态。其生成流程分四阶段,但也存在前景角色重建不准、背景生成不稳定等问题。

带你学AI
开源动态8

OpenAI未公开的o3「用图思考」技术,被小红书、西安交大尝试实现了

OpenAI推出的o3推理模型打破传统文字思维链边界,实现图像融入推理过程。小红书与西安交大联合构建多模态深度思考模型DeepEyes,尝试实现类似能力,还开源技术细节,在多任务中表现出色。

机器之心
算法论文8

让大模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026

复旦、创智联合推出RSAgent,让多模态大模型通过多轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在多个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。

量子位
新闻资讯8

RXD大会首发北京:当硅谷还在谈论物理AI,西门子已重写工业规则

3月23日,西门子Siemens RXD大会在北京开幕。西门子首席执行官博乐仁称,AI是通用型技术,公司有贯通硬软件与数据的技术栈。大会发布26款新品,多指向硬件,还展示了数字孪生等应用,凸显数据和行业知识重要性。

机器之心
新闻资讯8

DeepMind发布SIMA 2!打通「感知-推理-行动-反思」闭环

DeepMind推出的SIMA 2,可让智能体在虚拟环境中边聊天边进行复杂多模态推理。它整合Gemini能力,从指令执行者变为互动伙伴,有强大迁移泛化与自我提升能力,是迈向AGI重要一步,但也面临一些挑战。

新智元
开源动态8

社区供稿丨MiniCPM-V 4.5 技术报告正式出炉

上个月开源的多模态模型 MiniCPM-V 4.5 广受好评,今日其技术报告出炉。报告从架构、数据和训练三方面探索高效路径,提出三大技术,使模型在多任务上突破,小参数规模下性能和推理速度佳。

Hugging Face
推荐文章7

Vibe Working:AI Coding 泛化的终局想象 |AGIX PM Notes

文章围绕AI领域展开,探讨“Vibe Working”在AI编码及更广泛场景的应用,介绍工作流管理产品;还提及全球市场动态、多起AI相关商业合作与交易,以及ETF分红知识

海外独角兽
推荐文章7

用AI深读100本书,太上头了~

国外开发者Pieter让Claude深读100本非虚构类书籍,用AI‘深化’阅读。AI能在书间找联系,还生成奇葩分类并挖出洞见。实验带来三个启发,还给出低成本复制思路,强调学习要让知识建立连接。

CourseAI
算法论文8

VLM剪枝新SOTA:无需重训练,注意力去偏置超越6大主流方案

常用的attention机制存在位置偏置和padding异常,影响剪枝效果。上海大学曾丹团队提出无需重新训练的attention去偏方法,在多模型、剪枝策略及基准上验证有效,为多模态模型部署提供新思路。

新智元