「多模态视频生成大模型」共找到 3291 篇相关文章
马斯克再放大招!Grok AI短视频爆火,一夜全网刷屏
今天凌晨,马斯克更新Grok App,Grok Imagine向Grok Heavy用户推出,iOS App的Imagine功能升级。其生成的视频在𝕏上火爆,众多名人盛赞,它速度快,还将让原版Vine回归,对谷歌Veo 3形成挑战。
多模态大语言模型的核心技术架构与训练方法的进化
文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。
文心快码正式发布 AI IDE,生成超 43% 百度新增代码
6月23日,百度副总裁陈洋发布文心快码独立AI原生开发环境工具Comate AI IDE,这是行业首个多模态、多智能体协同的AI IDE。目前文心快码生成代码占百度每天新增代码超43%,在多方面有显著优势。
Anthropic封杀48小时,逼出OpenClaw最强反击!龙虾首次会生视频了
Anthropic封杀OpenClaw免费接口,OpenClaw推出2026.4.5王炸更新,支持视频生成和‘睡眠记忆’系统,还优化提示词缓存。虽与Anthropic有波折,也反映开源项目依赖大厂模型的困境。
如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26
AI视频生成技术发展快,现有检测方法难满足需求。新综述提出‘事实保真度验证’目标,梳理四层检测框架,涵盖底层线索、时空一致性等,强调多层证据耦合与可解释性,还分析评测指标与数据集。
谢赛宁也玩MC?开源全新世界模型生成多人一致的游戏视角
电子游戏推动AI发展,谢赛宁团队探索世界模型新方向,推出多人视频世界模型Solaris。该模型能生成多人一致的第一视角,团队还搭建了多人数据采集系统SolarisEngine,构建了多人Minecraft数据集。实验结果显示,其方法在多方面表现更优。
732M模型超越7B!机器人操控新范式:从视频中「悟」物理
机器人操控有「数据困境」,传统方法需大量人工标注动作演示数据。中山大学王广润教授团队从视频生成模型「借」物理直觉,提出PAR和PhysGen,与英伟达DreamDojo核心思路一致,验证了新的技术路线。
AI短剧成了!LibTV-seedance2支持“真人模式”:一手实测,视频闪电直出,效果炸裂
LibTV首发支持Seedance 2.0真人生成视频功能,操作简单严谨。真人出镜可用于虚拟主播、数字分身、角色替换等场景。该工具工作流高效,接入主流模型,价格有优惠。
ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能体
阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能体框架。它集成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。
世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana
北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解长时序等能力,背后有技术创新,且选择开源。