多模态训练」共找到 2839 篇相关文章

推荐文章7

AI们数不清六根手指,这事没那么简单。

作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。

数字生命卡兹克
新闻资讯7

The Btch:838 | 苹果加强生成式 AI 布局

苹果更新 Apple Foundation Models(AFM)系列,含设备端和服务器端版本,还发布 Foundation Models 框架。AFM 模型架构特别,训练有优化,测试表现有差异。此前苹果论文引争议,此次或是其重启 AI 战略之举。

DeeplearningAI
开源动态8

错过它=落伍!只用一张照片+14秒,腾讯开源 HunyuanVideo-Avatar 带你玩转多角色数字人

HunyuanVideo-Avatar 是腾讯混元团队最新开放的多模态数字人生成模型。上传一张人物图片,再配上一段音频,模型即可在约 14 秒内输出分辨率最高 720p、情绪可控、动作丰富且支持多角色同屏的短视频。

小华同学ai
算法论文8

首个时空时序推理框架:让大模型真正读懂时空数据 | ACL'26

STReasoner是首个结合时间序列、空间结构和自然语言的推理模型,能识别异常源、追踪影响路径。研究团队构建数据生成框架和评测基准,采用三阶段训练策略,模型在多任务表现优,成本低且泛化能力强。

新智元
算法论文8

让LLM扔块石头,它居然造了个投石机

港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。

量子位
开源动态8

8B硬刚72B!MiniCPM-V 4.5技术报告正式出炉

行业首个具备“高刷”视频理解能力的多模态模型MiniCPM-V 4.5技术报告发布,提出三项关键技术,使模型在多任务达同级SOTA,8B参数规模超72B模型,推理快,开源后获社区好评。

量子位
产品应用7

1美元训出专属滤镜,AI把ASCII游戏画质拉满

软件工程师Jeff Schomay用AI将ASCII风格游戏‘雷霆蜥蜴’实时‘翻译’成全动态图形游戏。他借助fal.ai平台解决速度问题,经历多次尝试平衡速度与画质,还训练专属LoRA模型提升画质,但仍面临帧间一致性难题。

AIGC开放社区
算法论文8

突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO

先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。

机器之心
产品应用7

FairyGen:AI 把孩子的画“动”起来,个性化教育和动画创作

FairyGen 能将孩子画作变成卡通短片,通过多模态大语言模型构思分镜脚本,采用分层建模处理前景人物动作与背景动态。其生成流程分四阶段,但也存在前景角色重建不准、背景生成不稳定等问题。

带你学AI
算法论文8

Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转

Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。

机器之心