通用动作生成框架」共找到 3049 篇相关文章

推荐文章7

告别模板时代!妙多VP张昊然:生成式AI如何驱动UI设计的范式革命

在AICon2025上海站,妙多副总裁张昊然分享生成式AI在UI设计领域的影响。他回顾初代生成式UI的‘套模板’技术,讲述技术革新后回归代码生成界面,还探讨让AI理解设计系统、妙多AI 2.0理念及未来UI工具假设。

InfoQ
推荐文章8

LLM-based Agent的代码生成综述

这篇2025年的综述指出,传统代码生成技术难完成复杂开发任务,而基于大语言模型(LLM)的代码生成代理应运而生。它把LLM作为“大脑”,具备自主规划等能力。文章梳理了该领域的核心特征、技术体系、应用实践等,也剖析了挑战与未来方向。

深度学习自然语言处理
算法论文7

ImageNet分数越高,生成反而越糊?iREPA给出解释

Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。

新智元
算法论文8

用子模优化法为DeepResearch生成多样性查询

开发DeepResearch时,生成多样化查询是关键。多数开源项目处理方法粗放,本文提出结合句向量与子模优化的方法,设计子模目标函数,给出代码实现,实验显示该方法生成的查询组合多样性更高。

Jina AI
算法论文7

SceneWeaver:面向通用三维环境生成的反思型智能体框架

室内场景合成在具身智能兴起下愈发重要,现有方法存在局限。BIGAI提出SceneWeaver框架,通过基于工具的迭代优化统一多样场景合成范式,具有高保真模拟、强健物理交互等优势。

带你学AI
开源动态7

免费开源低成本的3D动作捕捉系统

FreeMoCap是无标记点3D动作捕捉系统,用普通USB摄像头就能实现研究级全身动作捕捉,支持单/多相机模式,输出3D骨骼数据,可导入Blender等工具,具有低成本、开源可扩展等优势。

GitHubStore
开源动态8

腾讯开源全新动作迁移模型FlexiAct,人物 & 动物都支持

当前动作定制方法在应对多样化主体和场景时适应性差,清华与腾讯提出FlexiAct模型。它引入RefAdapter和FAE,能在空间结构差异大或跨域场景中精准适配动作,保持外观一致,表现优于其他方法。

带你学AI
产品应用8

太强了 Yan!腾讯打造的全能交互视频生成引擎

腾讯提出的面向交互式视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供可行路径,但也面临长时视频视觉一致性不足等问题。

带你学AI
开源动态7

OVI:统一的音视频生成模型,声音与画面同步诞生

音视频生成领域以往多阶段架构易致音画不同步等问题。耶鲁大学团队提出 OVI 统一范式,采用双塔 DiT 架构与分块式跨模态融合机制,实现音画同步生成,不过目前有计算开销大、音频有局限等问题。

带你学AI
产品应用7

低延时、可交互的音频驱动肖像视频生成框架LLIA

美团提出新型音频驱动肖像视频生成框架LLIA,是低延迟、可实时交互的虚拟形象生成技术。它提出四项核心技术,引入三大核心模块,构建超100小时数据集,在多方面有出色表现。

带你学AI