素材生视频」共找到 1079 篇相关文章

算法论文8

用2D数据解锁3D世界:首个面向运动学部件分解的多视角视频扩散框架

张昊等提出 Stable Part Diffusion 4D (SP4D) 框架,由 Stability AI 与 UIUC 联合完成。它能从单目视频成多视角 RGB 与运动学部件序列,解决运动学部件分解及自动 rigging 问题,实验效果显著,被 Neurips 2025 接受为 Spotlight。

机器之心
新闻资讯7

首个为手机而的通用 Agent?!苹果做不到的事,“野路子”智谱抢先实现了

苹果预计 2026 年升级 Siri 实现自主行动,但完整落地的执行型 Agent 未推出。8 月 20 日智谱发布 AutoGLM 2.0,称是全球首个可在手机用的 Agent,开创‘Agent + 云手机 / 云电脑’范式,能代理操作高频应用。

InfoQ
新闻资讯7

首个为手机而的通用Agent?!苹果做不到的事,“野路子”智谱抢先实现了

苹果预计2026年升级Siri实现自主行动,但完整落地的执行型Agent仍未推出。8月20日,智谱发布AutoGLM 2.0,宣称是全球首个可在手机用的Agent,开创‘Agent + 云手机 / 云电脑’范式,能代理操作高频应用。

AI前线
产品应用8

阿里云发布为Agent而的全新AI产品官网“千问云”,模型服务全面Skill、CLI化

5月20日,阿里云在2026阿里云峰会上发布全新AI产品官网“千问云”,提供150多款主流模型API,将模型服务核心能力封装为Skills和CLI工具,方便Agent调用,还提供便捷用量管理和多种付费模式。

阿里云开发者
算法论文8

清华联手英伟达打造扩散模型新蒸馏范式!视频成提速50倍,4步出片不穿模

清华大学朱军教授团队与NVIDIA Deep Imagination研究组联合提出分数正则化连续时间一致性模型(rCM),将连续时间一致性蒸馏扩展至大模型,解决现有方法瓶颈,提升推理速度兼顾质量与多样性。

量子位
开源动态8

Soul App 又又又开源了!这次是实时交互数字人,支持小时级长视频甚至无限时长!

Soul App 新开源实时数字人项目 SoulX-LiveAct,解决 AR 扩散模型流式成稳定性问题。它实现 20 FPS 实时流式推理,延迟 0.94 秒,支持无限时长,有恒定显存等亮点,可用于多场景。

开源星探
产品应用8

神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而

小米全新一代面向 Agent 的大模型家族官宣,包括 MiMo-V2-Pro Preview、MiMo-V2-Omni 和 MiMo-V2-TTS。MiMo-V2-Pro 性能优异,在多场景实测表现出色,技术有创新,API 开放且定价低,已融入小米多业务与态。

机器之心
产品应用8

阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了

阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。

AI工程化
新闻资讯7

Meta被控盗用成人影片训练AI,遭索赔3.6亿美金,成人影片居然是训练AI的最佳素材

美国成人影片制作公司Strike 3 Holdings指控Meta自2018年起下载并分享2396部成人影片,约81.7TB,用于训练AI模型,涉嫌严重侵权。Meta未回应,文章还分析了用成人影片训练AI的可能原因。

开源AI项目落地
算法论文8

无需NeRF/高斯点后处理,视频秒变游戏模型成现实!新方法平均每帧仅需60秒 | ICCV 2025

KAUST团队提出全新方法V2M4,能从单目视频直接成高质量、显式的4D网格动画资源。该方法构建多阶段流程,涵盖相机轨迹恢复等关键步骤,平均每帧约60秒,比现有方法显著提速,论文已被ICCV 2025接收。

量子位