实时视频生成」共找到 2866 篇相关文章

产品应用7

豆包可以跟你打视频了,陪我看《甄嬛传》还挺懂!难倒一众AI的“看时钟”也没难倒它

国产AI豆包发布视频通话新功能,能实时报准时钟时间,还接入联网搜索,准确性和时效性强。实测中,它可当看剧搭子,还能识别食材、解答物理题等,背后是豆包·视觉理解模型在发力。

量子位
开源动态8

3行代码做出自己的数字人,GitHub爆火的国产项目你用上了吗?

中国硅基智能推出HeyGem与DUIX两大开源项目,在GitHub引发热潮。HeyGem能快速克隆数字分身、生成4K视频,DUIX支持实时交互,二者构建完整技术闭环,推动数字人技术普及。

开源星探
产品应用7

让AI自动生成工作流

不会搭建工作流没关系,可让AI自动生成。如用Claude帮搭建n8n工作流,它生成JSON文件,复制粘贴到n8n配置节点即可用。介绍n8n特点,还讲了Claude自动生成n8n工作流的操作步骤。

newtype AI
开源动态8

「百万级」视频推理数据集!30+顶尖高校联合发布

AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。

新智元
算法论文8

李飞飞团队新作:简单调整生成顺序,大幅提升像素级图像生成质量

长期以来,AI生图面临潜空间模型细节损耗、像素空间模型结构混乱速度慢的矛盾。李飞飞团队最新论文提出Latent Forcing方法,通过重排生成轨迹,让像素扩散模型找回效率并刷新SOTA。

量子位
开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解大模型,公开3大核心创新技术。靠Slow - Fast视频编码等,在20 + 基准屠榜。它能精确视频定位,实验显示通用、视频理解和数学推理表现佳。

CourseAI
推荐文章7

下一代核心商业媒体,应该是视频播客

视频网站“降本增效”或靠视频播客,它性价比高,能让嘉宾持续输出。下一代核心商业媒体可能是头部视频播客,还分析了播客应是视觉系产品,中国播客发展路径或因环境改变。

乱翻书
算法论文7

ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成

本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。

机器之心
算法论文8

刷新3D生成上限!一键生成精细到毛发的3D资产

在高质量3D生成需求增长背景下,现有3D生成框架在兼顾效率和质量上有瓶颈。南洋理工大学等提出Ultra3D框架,采用coarse - to - fine两阶段流程,用Part Attention机制提升效率,支持高分辨率输出。

量子位
开源动态8

单卡搞定万帧视频理解!智源研究院开源轻量级超长视频理解模型Video-XL-2

智源研究院联合上海交通大学等机构发布新一代超长视频理解模型Video-XL-2。它单卡能处理万帧视频,编码2048帧仅需12秒,在效果、长度和速度上全面优化,已开放模型权重。

量子位