「风格一致性」共找到 297 篇相关文章
LiveWorld:视频世界模型新范式,让镜头之外的世界继续演化
现有视频世界模型存在“静态世界假设”,物体离开视野后状态不再更新。阿德莱德大学等研究者提出 LiveWorld,将世界演化与观察渲染解耦,使事件在视野外持续推进,并通过实验验证其有效性。
谷歌全新Gemini Omni首曝,视频版「香蕉」来了!教授黑板推公式全对
谷歌原生视频模型Gemini Omni意外曝光,其生成视频的连贯性、一致性惊艳,还能实现实时编辑。此前OpenAI的Sora App停服,谷歌I/O 2026将开幕,多款Gemini模型或亮相。
OpenAI宋飏被Meta挖跑了!扩散模型崛起关键人物,加入MSL再会师清华校友赵晟佳
最新消息,扎克伯格从OpenAI挖走华人研究员宋飏。他是扩散模型崛起关键人物,曾带队OpenAI战略探索团队。在OpenAI他成果显著,其研究或终结扩散模型。现加入Meta MSL,与清华校友赵晟佳会师。
刚刚!谷歌推出Nano Banana官方终极指南:六条保姆级权威提示教程,拿走不谢
谷歌推出Nano Banana(即Gemini 2.5 Flash Image图像模型)官方使用指南,含六条提示词模板及示例,介绍文生图等核心功能,还教你编写有效提示词发挥其潜力。
比NotebookLM更好的「开源播客」,可根据多模态内容生成30分钟以上播客音频。
Podcastfy是开源Python工具,能把文本、图片等多模态内容,借生成式AI转化为播客。它支持自定义,适配多种语言和文本转语音模型,能生成2 - 5分钟或30分钟以上的播客,使用体验比NotebookLM好。
SpaceX 600 亿美元收购 Cursor!马斯克不补课,直接买课代表
据外媒消息,SpaceX 斥资 600 亿美元收购 AI 编程初创公司 Cursor,交易将以股票完成,预计 2026 年第三季度完成。这是马斯克对 AI 编程战场的“补位”,因 xAI 在该领域落后,而 Cursor 有开发者入口价值且缺算力。
AIGC超新星专栏丨玩AI的小笼包:我离开互联网大厂,用AI重新定义“内容总监”
北京AIGC视听产业创新中心对话‘玩AI的小笼包’。她曾是大厂内容负责人,后投身AIGC创作。她分享了创作转型经历、‘超创’生态及工业化生产流程,也谈及技术挑战与行业发展方向。
Meta通过简单算术解锁LLM SoTA性能
大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。
阿里开源 Vivid-VR!带来逼真连贯的视频修复
阿里开源 Vivid - VR 用于视频修复,基于 T2V 模型结合 ControlNet 保证画面一致性。它引入概念蒸馏训练策略,设计控制特征投影器和双分支 ControlNet 连接器,实验展现出优异表现。
ElevenLabs 发布“视频到音乐”:AI 读懂视频内容,为其创作氛围匹配的 BGM。
ElevenLabs推出“视频到音乐”功能,其“Eleven Music”模型能分析视频上下文、情绪和风格,一键生成匹配的定制背景音乐,还能添加画外音和音效,为创作者提供端到端音视频解决方案。