视觉-语言生成」共找到 3485 篇相关文章

算法论文8

原来Veo 3早有苗头!人大联合值得买科技在CVPR 2025提出全新「图像到有声视频」生成框架

中国人民大学与值得买科技团队在CVPR 2025提出JointDiT框架,可从静态图像生成同步音视频。此研究定义图像到有声视频生成新任务,解决音视频融合难题,实验显示其效果优,还将拓展至四模态建模。

机器之心
开源动态8

腾讯发布混元3D世界模型1.0:首个支持物理仿真的开源世界生成系统

在2025年世界人工智能大会上,腾讯发布混元3D世界模型1.0,它是首个开源且兼容传统CG管线的可漫游世界生成模型。可通过文图生成3D世界,支持编辑、仿真,有360°沉浸、工业兼容、原子级交互优势。

量子位
产品应用8

腾讯3D生成模型上新!线稿可变“艺术级”3D模型,鹅厂内部设计师也在用

腾讯上新艺术级3D生成模型Hunyuan3D - PolyGen,支持生成复杂几何模型,鹅厂游戏工作室用后美术师建模效率提升超70%。该模型在拓扑功能实测表现佳,还介绍了其核心原理和技术。

量子位
算法论文8

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。

机器之心
产品应用8

4秒出百万面!突破千万面精度+12K高清贴图,手握数亿的3D生成公司下一局怎么打?

影眸科技旗下Hyper3D受英伟达青睐。该司完成数亿元融资,发布全新模型Hyper3D Rodin Gen - 2.5,引入类LLM的Thinking机制,4秒生成百万面级模型,还突破千万面精度,搭配12K原生3D贴图模型。

量子位
产品应用8

AI「解码」古罗马,重现千年铭文真相!DeepMind新模型再登Nature

借助DeepMind推出的生成式AI工具Aeneas,考古学家面对古代碑文不再抓瞎。它是多模态生成式神经网络,能助历史学家解读、归属和修复残缺文本,还可适应其他古代语言、文字和媒介。

新智元
算法论文8

图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心
开源动态8

Claude团队打开大模型「脑回路」,开源LLM思维可视化工具来了

Claude团队推出“电路追踪”工具,可生成归因图呈现LLM处理信息路径,支持在主流开源权重模型上快速生成。研究人员能借此解码LLM“决策逻辑”,官方还给出多语言电路等示例。

量子位
开源动态8

阿里Qwen悄悄放出6个开源权重,国庆卷疯了~

国庆期间,阿里通义千问悄悄放出6个开源模型权重,Qwen3-VL是通义千问系列最强大的视觉 - 语言模型。其30B版本多模态表现媲美GPT - 5 - Mini等,功能与架构均有升级。

PaperAgent
开源动态8

告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式

传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。

机器之心