多模态理解与生成」共找到 3413 篇相关文章

算法论文8

首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两大技术壁垒

新加坡国立大学等联合发布EgoTwin,首次实现第一视角视频与人体动作联合生成,攻克视角 - 动作对齐与因果耦合瓶颈。它基于扩散模型,通过三大创新设计解决核心难题,实验性能超基线,为多领域应用提供落地基座。

量子位
开源动态8

中英双语、29项第一、像素级理解:360 FG-CLIP2登顶全球最强图文跨模态模型

360推出FG-CLIP2图文跨模态VLM模型,在八大类任务、29项测试中超越Google与Meta。它能像素级看图,中英文皆强且已开源。其优势源于高质量数据集和先进训练方法,还在多业务落地并开放API。

机器之心
算法论文8

何恺明带大二本科生颠覆扩散图像生成:扔掉多步采样和潜空间,一步像素直出

何恺明团队提出新方法Pixel Mean Flow(pMF),突破传统扩散模型/流模型限制,砍掉多步采样和潜空间,一步在像素空间生成图像,在ImageNet不同分辨率上取得佳成绩,还介绍了核心设计、实验结果对比等。

量子位
算法论文8

ICDE 2026 | 从匹配困境到推理突破:阿里REG4Rec 激活生成式推荐的个性化潜力

阿里国际智能技术团队提出生成式推荐模型 REG4Rec,从表征学习、训练目标和推理策略层面设计,提升推理能力与稳定性。离线实验表现优,已在 Lazada 部署,带来显著商业收益,成果被 ICDE 2026 接收。

机器之心
算法论文8

让AI作画自己纠错!随机丢模块就能提升生成质量,告别塑料感废片

来自清华、阿里等的团队推出S² - Guidance方法,通过随机丢弃网络模块动态构建子网络实现自我修正。它避免了其他方法繁琐调参,在文生图和文生视频任务中显著提升生成质量与连贯性,且计算高效。

量子位
产品应用8

上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成

上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。

OpenMMLab
开源动态8

微软炸场了!一张图片仅需3即可生成带完整PBR材质的超高质量3D资产!

微软推出3D资产生成大模型TRELLIS,能接收文本或图像提示,输出高质量3D资产。其结果质量强,支持灵活切换输出格式和局部3D编辑,还给出安装和使用方法及项目地址。

GitHubStore
开源动态7

开源播客TTS神器!高效TTS模型:Muyan-TTS,0.33秒生成1秒音频,零样本语音合成!

介绍新发布的开源TTS模型Muyan - TTS,它专为播客场景设计,以超低延迟实现零样本语音合成,预训练大量播客数据,支持长内容连贯生成,还介绍了使用步骤、适用场景等。

开源星探
产品应用8

前端同事看走眼了,这个“游戏网页”其实全是AI写的!

Kimi K2.5上新,集视觉理解、代码生成等能力于一体,提供四种使用模式,其中Agent集群模式提效显著。实测显示其网页生成、动效理解能力出色,下一代K3模型或用新架构KDA降低计算成本。

InfoQ
算法论文8

任意骨骼系统的模型都能驱动?AnimaX提出基于世界模型的3D动画生成新范式

传统3D动画制作依赖骨骼绑定与关键帧编辑,成本高。现有自动化方法有局限。北京航空航天大学团队提出AnimaX框架,结合视频扩散模型与骨骼动画优势,支持任意骨骼拓扑,生成动画质量高、速度快,泛化能力强。

机器之心