「生成式框架」共找到 3784 篇相关文章
OVI:统一的音视频生成模型,声音与画面同步诞生
音视频生成领域以往多阶段架构易致音画不同步等问题。耶鲁大学团队提出 OVI 统一范式,采用双塔 DiT 架构与分块式跨模态融合机制,实现音画同步生成,不过目前有计算开销大、音频有局限等问题。
3D生成告别「穿模」噩梦!VASTx清华将蒙皮权重Token化,统一生成骨骼与权重,GRPO微调形变平滑
3D模型生成容易,让它“动起来”难,传统AI蒙皮算法有局限。SkinTokens研究将蒙皮权重离散化,构建TokenRig框架,引入GRPO算法,提升了AI自动绑定精度和泛化能力,助力3D动画自动生产。
Paper2Video:学术研究论文讲解视频自动生成
学术演示视频制作耗力,Show Lab提出Paper2Video基准数据集和PaperTalker多智能体框架,可从学术论文自动生成演示视频。还引入定制化评价指标,衡量学术演示视频效果。
一句话生图要过时了?开源图像生成Agent进化出「工具编排」
来自多机构的研究团队提出GenEvolve,将开放图像生成建模为「工具编排轨迹」。它配置三类工具,经多轮决策完成生成。通过构建数据集训练,实验显示在多基准上表现出色,已开源模型、代码等。
当搜索遇见 AIGC:京东零售的“千人千面”素材生成实践
在 AIGC 浪潮下,视觉生成技术重构电商生态。京东零售李岩介绍“千人千面”商品素材生成技术链路,包括关键模型及实现框架,还发布焕新版京点点平台并预告新能力,推动电商个性化变革。
“由 AI 生成的代码,从诞生那一刻起就是「遗留代码」!”
如今生成式AI融入软件开发,AI生成的代码一诞生或被视为“遗留代码”。它缺乏上下文记忆和维护连续性,虽有开发者尝试弥补,但代码未来或多靠提示生成。文章观点在Hacker News引发讨论。
全球首个多模态矢量动画生成框架,轻松拿捏跨平台轻量动画
复旦大学等团队推出OmniLottie框架,利用创新分词技术将视频、图文指令变成高质量矢量动画。团队还打造数据集MMLottie - 2M,构建测试基准MMLottie - Bench。实验显示,OmniLottie在多任务测试中优势明显。
谷歌DeepMind深夜放核弹:世界模型Genie 3登场,重新定义“生成式AI”
谷歌DeepMind推出第三代通用世界模型Genie 3,能生成多样化交互式环境,可实时导航。它较前代有诸多突破,有模拟物理特性等核心能力,能赋能具身智能体研究,但也存在行动空间有限等局限。
Vercel 开源 json-render!短短 4 天狂揽 7500 Star,这才是 AI 生成 UI 的终极解法!
Vercel 开源的 json - render 4 天获 7500 Star,解决生成式 UI 不可控问题。采用‘AI → JSON → UI’公式,结合‘约束’与‘流式’机制,还有反向生成源码功能,介绍了快速入手办法与适用场景。
斯坦福&SambaNova联手发布ACE框架:上下文即战力
文章介绍了斯坦福与SambaNova联手发布的ACE框架。它解决传统提示工程缺陷,将提示工程升级为智能体自我演化体系。通过“生成 - 反思 - 策展”闭环,实现上下文低成本、低延迟、高扩展演化,小模型搭配它能击败大模型+传统提示。