图像到有声视频」共找到 1340 篇相关文章

产品应用8

可灵 2.1 首尾帧藏师傅外挂教程:两张图→大片,附万能提示词

作者分享可灵 2.1 首尾帧模型测试与使用教程,解决图片和提示词生成难题。介绍三种拿图法,给出 AI 生成提示词方法及原则,还指出可将流程固化、特效升维,提升视频创作效率与价值。

歸藏的AI工具箱
产品应用8

实测参考生之王Vidu Q3:这已经不叫AI生成了,这叫AI驱动整个剧组

4月13日生数科技发布视频大模型Vidu Q3,在SuperClue榜单断层登顶。它从‘生成视频’转向‘驱动剧组’,升级后能嵌入内容生产流程,实现‘万物可参,声画同出’,在多赛道表现亮眼。

机器之心
开源动态8

字节跳动开源超强USO模型,AI绘图六边形战士来了

在AI图像生成领域,风格和主题驱动的图像生成一直脱节。字节跳动智能创作实验室推出USO模型,构建海量数据集,设计两阶段训练法,引入风格奖励学习范式,化解此难题,且已全面开源。

AIGC开放社区
7

AI Video Is Eating The World,创作者、创业者的机会在哪?

AI视频生成虽仍有技术问题,但已重塑短视频创作生态,衍生出新的内容商业化模式。a16z合伙人分享创作经验、变现方式与创业机会,还提到爆款公式、成本挑战及不同平台内容特点。

Founder Park
开源动态8

重磅开源!240亿参数力压Nano Banana 2

4月初,京东探索研究院开源JoyAI - Image - Edit图像模型。它是业内首个将「空间智能」写进底层的开源一体化图像模型,能让模型「理解空间,编辑空间」,在电商和具身智能场景极具价值。

新智元
算法论文7

好玩!AI模仿人类‘空像错觉’,开启想象力之旅

越南国立大学提出Shape2Animal框架,模仿人类‘空想性错觉’,将自然物体轮廓转化为动物图像。该框架经多阶段流程,结合多种技术生成画面,但也继承了基础模型的一些局限性。

带你学AI
新闻资讯7

10 天 3000 元,一人造出全球 AI 爆款!好莱坞导演抢人、游戏版引爆期待,合作细节首次披露

中国 29 岁中专毕业的 AI 视频创作者 Mx - Shell 用 10 天、3000 元成本做出 AI 短片《丧尸清道夫》爆火,海外 CEO 邀合作。其游戏版正制作,Yoroll 创始人谈 AI 视频游戏赛道玩法、商业化及行业变革。

InfoQ
产品应用7

龙虾开始自己拍电影了:我在 LibTV 里看着它从一句话做到成片

作者试用 AI 视频产品 LibTV,仅给 Claude Code 发一句话“「黑神话哪吒」视频制作”,约 10 分钟就得到视频初稿。LibTV 能搭好 0 到 60 的地基,留下可继续创作的画布,成本低还能多尝试,最后仍需人把关。

AI产品自由
开源动态8

o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石

文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。

量子位
算法论文8

谢赛宁、李飞飞、LeCun联手提出多模态LLM新范式,「空间超感知」登场

纽约大学助理教授谢赛宁与李飞飞、Yann LeCun 合作提出「Cambrian - S」,迈出视频空间超感知探索第一步。该研究引入 VSI - Super 基准,还提出预测性感知范式,在空间认知任务上有提升,相关论文值得视频多模态研究者参考。

机器之心