文本到 3D 生成」共找到 4229 篇相关文章

算法论文7

手机上实现AI视频实时生成,DiT模型上移动端

扩散变换器在视频生成任务性能强,但计算成本高,在手机上难实用。Snap提出创新优化法,加速视频生成,能在iPhone 16 Pro Max上每秒超10帧,不过也存在细节退化等局限。

带你学AI
开源动态8

视频生成Prompt何须仅是文字!字节&港中文发布Video-As-Prompt

AI视频生成中,依赖抽象语义控制的创作因缺乏统一条件表征而困难。字节与港中文团队提出Video - As - Prompt框架,引入‘视频参考’范式,实现抽象语义下可控视频生成范式统一,代码和数据集已开源。

机器之心
新闻资讯7

Cloudflare 如何将 Quicksilver 迁移多级缓存并处理数十亿个请求

Cloudflare 工程团队分享将全局键值存储 Quicksilver 过渡分层缓存架构的故事。从 V1 V2 迁移,采用多级缓存策略,解决存储、一致性等问题,提升性能,多数请求可在短时间内响应。

InfoQ
产品应用8

verify-data:一个端端的数据验数 Agent Skill

本文介绍端端数据验证 Agent Skill——verify-data,它能自动完成从表结构获取报告发布全流程,将传统手工验数升级。文章从多方面展开介绍,还给出未来演进方向,为开发者提供参考。

阿里云开发者
算法论文8

X-Actor 惊艳登场!长时唇动+情感同步人像动画生成

字节提出 X - Actor,一个音频驱动自回归扩散框架,能通过一张静态参考图像和一段音频生成逼真、富有情感表达的人像动画视频。其核心是两阶段解耦生成流程,实现长时间唇形同步与情感音频一致性。

带你学AI
产品应用8

从Vibe CodingAgentic Engineering:重构后台开发全流程

文章介绍从 Vibe Coding Agentic Engineering 的转变,以真实需求为例,展示后台开发全流程,涵盖需求获取合入发布各阶段,介绍各阶段工具及操作,凸显 Agentic Engineering 优势,强调人编排、AI 执行的核心理念。

腾讯技术工程
算法论文8

用3D几何先验驱动视频扩散,实现更一致的世界生成

视频扩散模型生成新视角视频时,现有方法缺显式3D结构。智象未来提出DreamWorld,用3D先验与两阶段框架,结合结构和生成能力,在多基准测试表现领先。

机器之心
开源动态7

Gamma完美开源平替,输入主题一键生成专业PPT,配图排版全自动!

做PPT耗时耗力,现有AI驱动PPT生成工具多为闭源SaaS服务。GitHub上的开源项目presentation-ai是Gamma的开源平替,输入主题可自动生成PPT,功能丰富,还给出安装部署步骤和使用场景。

开源星探
算法论文8

Sora没做的,LongVie框架给解决了,超长视频生成SOTA

视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。

机器之心
开源动态8

美团视频生成模型来了!一出手就是开源SOTA

美团开源视频生成模型LongCat - Video,参数13.6B,支持文生/图生视频,时长可达数分钟,生成视频真实自然,文生视频能力顶尖,整体质量优,采用MIT协议。还介绍了其功能、技术原理及美团此前的AI成果。

量子位