「长视频生成」共找到 3148 篇相关文章
AI 大牛刘威创业公司完成 5000 万美元融资,12 月将发布新模型
当地时间11月5日,刘威创立的Video Rebirth完成5000万美元种子轮融资,用于打造视频生成模型。公司计划12月发布Bach模型及AI视频生成平台,将与OpenAI Sora竞争,虽对手强大,但刘威认为小团队有机会。
图像、视频一模搞定!字节全能原生多模态本地可部署
字节开源原生多模态模型Lance,仅3B激活参数,40G显存就能跑,已登顶huggingface趋势榜。它能进行图像与视频的理解、生成、编辑等操作,在多个基准测试中表现优异,多项性能居首。
当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?
在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。
硬刚Sora2,万相2.6轻松定制角色、控制分镜,普通人也能当导演
2025 年视频生成领域发展迅猛,OpenAI 的 Sora 2 带来新玩法,商业落地加速,但普通用户体验门槛高。12 月 16 日阿里发布万相 2.6 系列模型,功能全面升级,实测效果惊人,标志 AI 视频生成迈向精准可控新阶段。
字节Seed提出M3-Agent:像我们一样"记住"与"思考"的长视频理解新范式
字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决长视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。
SSM+扩散模型,竟造出一种全新的「视频世界模型」
在AI热词不断涌现的时代,斯坦福大学等机构研究将长上下文、状态空间模型、扩散模型等结合,创造全新「视频世界模型」。它用状态空间模型实现长期记忆,还设置局部注意力机制,训练和推理表现出色。
太逼真!豆包·播客模型来了:一句话生成「苏超联赛」播客,很懂13太保的梗
火山引擎发布豆包·播客模型,生成的AI对话语气、停顿等像真人。操作简单,生成快且有字幕。能处理多种类型内容,如热搜话题、苏超联赛、超长文本等。其基于端到端实时语音模型,有技术突破。
马斯克再放大招!Grok AI短视频爆火,一夜全网刷屏
今天凌晨,马斯克更新Grok App,Grok Imagine向Grok Heavy用户推出,iOS App的Imagine功能升级。其生成的视频在𝕏上火爆,众多名人盛赞,它速度快,还将让原版Vine回归,对谷歌Veo 3形成挑战。
面壁MiniCPM-V4.5新王炸!8B手机10FPS长视频秒懂,文档手写全能识别!
面壁上新最强端侧多模态模型MiniCPM-V 4.5,基于Qwen3 - 8B与SigLIP2 - 400M构建,总参数量8B。它视觉语言理解强、手机能跑,有高帧率视频理解等特点,还有多方面技术亮点。
蚂蚁发布全球首个视频-动作世界模型,开源即刷新世界纪录
从Sora惊艳亮相到谷歌开放Genie 3线上体验,世界模型从概念走向交互世界。蚂蚁旗下蚂蚁灵波开源全球首个视频 - 动作世界模型LingBot - VA,可驱动机器人完成复杂操作,解决长时漂移等问题,还提出工程化解法。