长视频生成」共找到 3148 篇相关文章

新闻资讯7

AI 大牛刘威创业公司完成 5000 万美元融资,12 月将发布新模型

当地时间11月5日,刘威创立的Video Rebirth完成5000万美元种子轮融资,用于打造视频生成模型。公司计划12月发布Bach模型及AI视频生成平台,将与OpenAI Sora竞争,虽对手强大,但刘威认为小团队有机会。

AI前线
开源动态8

图像、视频一模搞定!字节全能原生多模态本地可部署

字节开源原生多模态模型Lance,仅3B激活参数,40G显存就能跑,已登顶huggingface趋势榜。它能进行图像与视频的理解、生成、编辑等操作,在多个基准测试中表现优异,多项性能居首。

AIGC开放社区
推荐文章8

当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增 60 倍?

生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。

海外独角兽
产品应用8

硬刚Sora2,万相2.6轻松定制角色、控制分镜,普通人也能当导演

2025 年视频生成领域发展迅猛,OpenAI 的 Sora 2 带来新玩法,商业落地加速,但普通用户体验门槛高。12 月 16 日阿里发布万相 2.6 系列模型,功能全面升级,实测效果惊人,标志 AI 视频生成迈向精准可控新阶段。

机器之心
算法论文8

字节Seed提出M3-Agent:像我们一样"记住"与"思考"的视频理解新范式

字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。

深度学习自然语言处理
算法论文7

SSM+扩散模型,竟造出一种全新的「视频世界模型」

在AI热词不断涌现的时代,斯坦福大学等机构研究将上下文、状态空间模型、扩散模型等结合,创造全新「视频世界模型」。它用状态空间模型实现期记忆,还设置局部注意力机制,训练和推理表现出色。

机器之心
产品应用8

太逼真!豆包·播客模型来了:一句话生成「苏超联赛」播客,很懂13太保的梗

火山引擎发布豆包·播客模型,生成的AI对话语气、停顿等像真人。操作简单,生成快且有字幕。能处理多种类型内容,如热搜话题、苏超联赛、超文本等。其基于端到端实时语音模型,有技术突破。

量子位
新闻资讯7

马斯克再放大招!Grok AI短视频爆火,一夜全网刷屏

今天凌晨,马斯克更新Grok App,Grok Imagine向Grok Heavy用户推出,iOS App的Imagine功能升级。其生成视频在𝕏上火爆,众多名人盛赞,它速度快,还将让原版Vine回归,对谷歌Veo 3形成挑战。

新智元
产品应用8

面壁MiniCPM-V4.5新王炸!8B手机10FPS视频秒懂,文档手写全能识别!

面壁上新最强端侧多模态模型MiniCPM-V 4.5,基于Qwen3 - 8B与SigLIP2 - 400M构建,总参数量8B。它视觉语言理解强、手机能跑,有高帧率视频理解等特点,还有多方面技术亮点。

CourseAI
开源动态8

蚂蚁发布全球首个视频-动作世界模型,开源即刷新世界纪录

从Sora惊艳亮相到谷歌开放Genie 3线上体验,世界模型从概念走向交互世界。蚂蚁旗下蚂蚁灵波开源全球首个视频 - 动作世界模型LingBot - VA,可驱动机器人完成复杂操作,解决时漂移等问题,还提出工程化解法。

MacTalk