语义动作流」共找到 610 篇相关文章

开源动态8

DeepSeek又拿第一!首创「因果」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元
算法论文8

盛大AI研究院新作:式生成超越非式,一句话让虚拟人动作丝滑如真,推理延迟仅1帧

盛大AI研究院与东京大学联合提出FloodDiffusion,首个基于定制化扩散强制的式人体动作生成框架。它能零延迟生成无限长动作序列,解决了现有方法的问题,在多数据集评估中表现优异。

量子位
算法论文8

仅看视频就能copy人类动作,宇树G1分分钟掌握100+,UC伯克利提出机器人训练新方式

UC伯克利团队研发出名为VideoMimic的新系统,能将视频动作迁移到真实机器人。它已让宇树G1模仿100多段人类动作,还能适应各种地形。其工作程含视频转仿真、仿真训练策略、策略迁移到实体机器人。

量子位
算法论文8

为什么自监督永远学不到语义

《Visual Language Hypothesis》论文用纤维丛理论审视视觉表征学习,指出只做连续变换难触达语义。分析现有无监督学习不足,提出“Expand - and - Snap”机制,还通过实验验证,提供审视AI架构新视角。

深度学习自然语言处理
产品应用7

精准复刻!字节推出X-UniMotion实现高精度动作模仿合成

字节推出的X-UniMotion代表角色动画技术突破,提供统一运动控制系统,融合先进算法与操作界面,构建强大技术架构,能生成自然畅角色动作,还介绍了其技术原理、演示对比等内容。

带你学AI
算法论文8

ICML 2025 Spotlight | 新理论框架解锁匹配模型的引导生成

西湖大学冯睿骐、吴泰霖等针对匹配模型能量引导算法难题,推导新理论框架,提出三大类实用算法,给出性能分析与比较,为匹配引导采样及生成模型应用提供理论基础。

机器之心
算法论文8

视觉模型既懂语义,又能还原细节,南洋理工&商汤提出棱镜假说

南洋理工与商汤团队提出 Prism Hypothesis(棱镜假说)与 Unified Autoencoding(UAE)。论文指出视觉基础模型中语义理解和像素保真很难兼得,用频率谱统一视角解决冲突,UAE 实验效果良好。

机器之心
算法论文8

何恺明组三位本科生领衔!持续聚焦Flow模型,突破归一化生成效率瓶颈

何恺明团队新作聚焦Flow模型,提出双向归一化(BiFlow)框架,解耦前向与逆向过程,打破传统归一化生成模型效率低下问题。三位一作是本科生,实验显示其速度和质量表现出色。

量子位
算法论文8

稳定训练、数据高效,清华大学提出「策略」强化学习新方法SAC Flow

本文介绍清华大学和CMU提出的SAC Flow新方案,可端到端优化策略。它将策略视作residual RNN,用GRU和Transformer结构稳定训练。在多环境测试中表现优,有稳定、快速、样本效率高的特点。

机器之心
开源动态8

不止动起来:SentiAvatar重新定义3D数字人动作生成范式

AI 初创公司 SentiPulse 联合团队提出 3D 数字人动作生成新范式 SentiAvatar,打造虚拟角色 SUSU,其框架等已全球同步开源。它解决了高质量数据荒等问题,实验表现优,还实现快速动作生成,支持式交互。

机器之心