视频动捕」共找到 1105 篇相关文章

新闻资讯8

Gemini负责人爆料!多模态统一token表示,视觉至关重要

Gemini模型行为产品负责人Ani Baddepudi与谷歌AI Studio产品负责人探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。

量子位
推荐文章7

LLM学习笔记:最好的学习方法是带着问题去寻找答案

文章总结拓展Andrej Karpathy教学视频,分析大模型聊天流程与原理,介绍LLM训练步骤,包括预训练、后训练和强化学习,还提及主流特性应用,如文件上传、网络搜索,强调带问题学习的重要性。

腾讯技术工程
开源动态8

告别“音画割裂”与“人物崩坏”!AutoMV:首个听懂歌词、卡准节拍的开源全曲级MV生成Agent

现有AI视频生成模型做全曲MV有时长限制、音画割裂和一致性差等问题。AutoMV作为开源多智能体系统,模拟人类影视制作流程,能生成长达数分钟、叙事连贯且音画同步的完整MV。

量子位
新闻资讯7

提示词一响,烂片登场,OpenAI谈下200+迪士尼顶级IP出场费

迪士尼官宣向OpenAI投资10亿美元,签三年合作协议,授权Sora用旗下200多个顶级IP生成短视频。此前好莱坞与AI版权纷争不断,如今迪士尼选择变现,但生成内容或影响其品牌形象。

机器之心
产品应用7

实测新版LiblibAI:终于把模型、生图、工作流塞进一个碗了

本文实测新版LiblibAI,它上线多个模型,添加视频特效玩法。从“找模型”网站变为“AIGC流水线”平台,界面风格转变。虽有亮点,但也存在出图慢、模型惊喜感弱、页面卡顿等问题。

量子位
算法论文8

任意骨骼系统的模型都能驱?AnimaX提出基于世界模型的3D画生成新范式

传统3D画制作依赖骨骼绑定与关键帧编辑,成本高。现有自化方法有局限。北京航空航天大学团队提出AnimaX框架,结合视频扩散模型与骨骼画优势,支持任意骨骼拓扑,生成画质量高、速度快,泛化能力强。

机器之心
新闻资讯8

谷歌NotebookLM终于说中文了!这可是最火的大模型播客产品

NotebookLM正在变成谷歌AI路线里靠谱选手,现支持中文播报且将推移App。它能将音频源转化为类似播客的对话,有摘要等功能,音频概览功能受欢迎,底层是谷歌Gemini 2.5 Flash,实用性强,即将上线安卓和iOS版App 。

机器之心
新闻资讯8

大模型全面爆发,所有榜一都是Gemini!谷歌一夜站到了台前

北京时间今日凌晨,Google I/O 2025 开发者大会开启。谷歌发布或升级系列 AI 工具与服务,如升级 Gemini 模型、推出编程智能体 Jules 等,还展示视频图像生成模型、搜索与购物模式升级,展现其在 AI 应用领域强势回归。

机器之心
产品应用7

一台工业具身机器人,从理想到现实要经过哪些坑?

在具身智能赛道,‘落地’常被滥用。聆通用在‘工业落地’上很果决,以‘商业有闭环’和‘批量可复制’为核心指标。他们选择物流场景起步,推出LDB机器人,还面临量产和运营难题。

AI科技评论
产品应用7

MMX-CLI给AI Agent装上七种感官,内容创作更方便

MiniMax发布的MMX - CLI命令行工具,给AI Agent装上七种新感官,具备图像生成、视频创作等能力,可一站式解决内容创作问题。它安装使用简单,功能多,还能集成到现有工作流,不过采用按量付费。

AI工程化