「Video Diffusion Model」共找到 227 篇相关文章
视频生成比播放还快:开源VDN-H3,14秒视频11秒搞定
近期,网络出现“无限流”视频,源于MiniMax H3。OpenVDN团队开源Video Delta Net(VDN),基于MiniMax H3使视频生成速度提升75到90倍,14.4秒的768p视频11.23秒就能生成。它采用混合思路,性能提升显著。
AI视频杀出一匹“快乐黑马”:把Seedance 2.0挤下榜首,幕后团队成谜
4月7日深夜,AI评测平台公告Video Arena新增匿名视频模型HappyHorse - 1.0,48小时后积分登顶,超过Seedance 2.0。网友猜测其出自中国团队,有线索指向Sand.ai等联合团队或阿里淘天集团。实测表现有亮点,Elo评分合理性存疑。
突破一亿Token极限:EverMind提出MSA架构,实现大模型高效端到端长时记忆
机器之心发布文章介绍,大模型长期记忆能力受限于上下文长度。《MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens》提出MSA架构,突破扩展性、精度和效率的不可能三角,实现100M长度的大模型长时记忆框架。
对标GPT-4o和香蕉!浙大开源ContextGen:布局身份协同新SOTA
浙江大学ReLER团队开源ContextGen框架,攻克多实例图像生成中布局与身份协同控制难题。基于Diffusion Transformer架构,用双重注意力机制实现布局精准锚定与身份高保真隔离,在基准测试中超越开源SOTA模型,对标GPT - 4o等闭源系统。
用2D数据解锁3D世界:首个面向运动学部件分解的多视角视频扩散框架
张昊等提出 Stable Part Diffusion 4D (SP4D) 框架,由 Stability AI 与 UIUC 联合完成。它能从单目视频生成多视角 RGB 与运动学部件序列,解决运动学部件分解及自动 rigging 问题,实验效果显著,被 Neurips 2025 接受为 Spotlight。
阿里自己上场,用Qwen3做起了SmartResume应用
近期,阿里用Qwen3-0.6B+YOLOv10做了智能简历解析系统SmartResume,Code、Model、Paper都已开源。该系统支持多种文档格式,融合OCR与PDF元数据完成文本提取,结合版面检测重建阅读顺序,并通过LLM将内容转换为结构化字段。
昨天夸国产大模型争气,今天Vidu Q3就霸榜了
国产视频大模型Vidu Q3在国际权威AI基准测试机构Artificial Analysis的最新榜单里,于Video Arena冲到全球第二、国产第一。它是全球首个支持16秒音视频直出模型,声画同出、高清直出,还有镜头控制、多语言文字渲染等优势。