「帧级动作控制」共找到 754 篇相关文章
OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式
现有视频数字人模型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多模态 DiT 架构和伪末帧设计,使模型融合多模态信号,生成高质量角色动画。
藏师傅教你用 Nano Banana 编辑图片做手办
前几天发 Nano Banana 测评后,很多人不知怎么用。刚好做手办图玩法火了,作者教大家在 LM Arena 用 Nano Banana 编辑图片、做手办图,还介绍把图片变视频及剪辑的方法。
Talking-Critic奖励模型带来更自然的音频驱动肖像
近期音频驱动肖像动画技术发展快,但现有方法存在嘴型声音不对、动作不自然等问题。阿里提出Talking - Critic奖励模型,构建Talking - NSQ数据集,还提出TLPO优化框架,提升多维度表现,实验超现有SOTA方法。
挤不动的世界机器人大会上,自变量秀出了真·通用具身智能
2025世界机器人大会上,自变量机器人展示多项成果。通用轮式双臂机器人“小量”“小白”能完成制作香囊、家务整理等任务;“量子2号”仿人形机器人动作精准自然;其具身智能基座模型WALL - A有强大泛化性。
构建会“说话”和“行动”的 AI:生成式数字人技术与 EchoMimic 实践
在 QCon 全球软件开发大会上,支付宝李宇明围绕 EchoMimic 介绍生成式数字人进展、技术、应用及研究思路。对比传统数字人,生成式数字人成本低、易控制,但也有技术新、推理成本高的问题。EchoMimic 两版本已开源,经优化推理速度可提升。
LeCun出手,造出视频世界模型,挑战英伟达COSMOS
训练有效世界模型面临数据、任务难度、算力消耗和评估等难题。Meta研究者提出通用视频世界模型DINO - world,可预测未来帧,在多方面有优势,实验显示其性能显著,能降低对标注数据需求。
比女皇报告还炸裂!67页AI深度调研刷屏,全球LLM大决战真正开始
硅谷财富管理巨头Iconiq Capital发布《2025年AI现状报告》,实测300家AI公司落地路径,揭示AI从概念走向实战的七大真问题,解析从构思到部署AI产品路径,核心关注高效构建、规模化落地等。
深度拆解:为什么通用 Agent 的下一站是 Agentic Browser?
文章指出 2025 年 AI 圈新风暴眼 Agentic Browser 正形成。从 Perplexity 故事讲起,阐述传统系统和浏览器限制通用 AI 发展。厘清通用 Agent、AI 搜索等概念,分析 Agentic Browser 成通用 Agent 下一站的原因,预测 OpenAI 相关产品秋季前发布。
LeCun世界模型出2代了!62小时搞定机器人训练,开启物理推理新时代
Meta开源发布V-JEPA 2世界模型,图灵奖得主Yann LeCun称其将为机器人技术带来新时代。该模型能理解物理世界,经训练后在多方面表现优异,Meta还发布新基准测试,也透露了后续计划。
10%训练数据超越100%表现,机器人学习领域迎来重要突破
密歇根大学和瑞典皇家理工学院团队提出 ViSA - Flow 框架,能从人类视频提取语义动作流,提升机器人数据稀缺时学习效率。在 CALVIN 测试中,用 10% 训练数据超越 100% 数据方法,有技术优势也存在局限。