「角色融合」共找到 763 篇相关文章
语音模型也能“freestyle”?可定制角色,模拟背景音
阿里新推两款语音模型,Fun - CosyVoice3.5可基于参考音频克隆声音,优化多方面能力;Fun - AudioGen - VD能进行‘从无到有’音色设计,并模拟复杂听觉环境。用户即日起可在阿里云百炼调用。
OmniAvatar震撼开源!阿里夸克开源全新音频驱动角色模型
音频驱动人体动画技术有局限,阿里夸克团队推出OmniAvatar模型。它用逐像素多层次音频嵌入和LoRA训练法,解决唇动同步等问题,适用于多领域,但也存在颜色偏移等不足。
在 AI 增强的变革流中,架构师要承担何种角色?
数据显示多数组织采用AI却未获实质价值,技术进步但组织影响参差不齐。架构师可弥合组织目标与开发速度的鸿沟,利用AI增强架构实践,案例展示了架构流动性在实践中的体现。
Claude Mythos核心架构开源!22岁天才一人破解,融合DeepSeek思路
22岁初创CEO Kye Gomez以第一性原理推导出Claude Mythos核心架构,开源OpenMythos项目。该架构采用循环深度Transformer,不堆参数,循环思考16次推理,结合MoE层,参数效率翻倍。
锁定角色,「多主体」也可控!个性化文生图,给你PS般交互体验
LayerComposer革新个性化图像生成,能让用户如在Photoshop般操控元素位置、大小,解决传统方法交互性与多主体扩展难题。它有分层画布、锁定机制、模型–数据共设计三大特点,实验表现出色,未来将促进人机协同创作。
Alibaba力作:Ovis-U1 融合理解、生成与编辑,解锁无限可能
OpenAI 2025 年推出的 GPT - 4o 结合图像与语言能力,但引发视觉解码器设计及统一模型训练问题。Alibaba 力作 Ovis - U1 单一模型能完成理解、生成与编辑任务,介绍了其架构、训练过程和应用。
字节跳动:Apache Doris + AI 一站式融合数据引擎的探索与实践
本文整理自字节跳动 DataMind 负责人演讲,介绍了基于 Apache Doris 打造的一站式引擎 DataMind。它集成 Hybrid Search、AI Function、GraphRAG 等能力,部分成果已贡献开源,还给出企业级 AI 问数落地方案。
首个多人对话视频生成框架MultiTalk,角色有表情还能互动
现有音频驱动人体动画方法多聚焦单人,处理多音频流能力弱、指令跟随有局限。中山大学提出多人对话视频生成新框架MultiTalk,介绍了技术原理,演示效果显示其指令跟随能力强、伪影少。
CVPR 2026 | BiMotion:用 B 样条曲线重新定义 3D 角色运动生成
爱丁堡大学等团队提出 BiMotion 框架,将在 CVPR 2026 发表。它用 B 样条曲线表达运动,解决现有方法问题,有独特架构和损失函数,实验表现优,代码和数据集已开源。
GPT-5攻入数学圈,证明定理快过博士生?网友热议AI新角色
9月初,arXiv一篇论文将GPT - 5写进数学研究成果。它解决了第四矩定理‘收敛速度’的空白,还在凸优化领域提升收敛界限。不过它常犯错,需人类引导,且成果原创性存疑,引发对科研和博士培养的担忧。