「视频扩散Transformer」共找到 1372 篇相关文章
重构线性视觉Transformer,精度与效率双平衡 | CVPR'25
南洋理工、北航与合工大联合提出CARE Transformer,以非对称解耦建模局部与全局,降低计算开销、提升特征表达。实验显示其在移动端低延迟高精度,打破“效率与精度不可兼得”困局。
看懂这篇,你就能秒懂 LLM底层秘密—Transformer原理解析
文章由浅入深介绍LLM基础知识,着重解析Transformer原理,结合案例讲解其工作流程,还介绍当前开源旗舰LLM架构变化,如DeepSeek V3等模型的创新,最后强调模型能力与应用形态的关系。
马斯克再放大招!Grok AI短视频爆火,一夜全网刷屏
今天凌晨,马斯克更新Grok App,Grok Imagine向Grok Heavy用户推出,iOS App的Imagine功能升级。其生成的视频在𝕏上火爆,众多名人盛赞,它速度快,还将让原版Vine回归,对谷歌Veo 3形成挑战。
首篇,系统盘点扩散模型高危漏洞!看懂攻击方式和防御体系
随着扩散模型广泛应用,其安全问题凸显。天津大学团队论文系统梳理文生图模型攻击方式、风险类型、威胁场景与防御体系,指出当前防御不足,需建立更体系化防护体系。
3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?
7月31日MiniMax H3和字节跳动Seedance 2.5同日发布,3天后H3开源,8月7日Seedance 2.5开放api。模型变强使产品层要做的事更多,视频Agent需解决生产问题,竞争走向模型层之上。
谷歌创始人布林:当年发完Transformer论文,我们太不当回事了
在斯坦福大学工程学院百年庆典活动上,谷歌联合创始人谢尔盖・布林与校长、工程学院院长对谈。他回顾谷歌发展,称曾对Transformer论文未足够重视,还分享对专业选择、大学模式、学术与产业等方面的看法。
用2D数据解锁3D世界:首个面向运动学部件分解的多视角视频扩散框架
张昊等提出 Stable Part Diffusion 4D (SP4D) 框架,由 Stability AI 与 UIUC 联合完成。它能从单目视频生成多视角 RGB 与运动学部件序列,解决运动学部件分解及自动 rigging 问题,实验效果显著,被 Neurips 2025 接受为 Spotlight。
蚂蚁发布全球首个视频-动作世界模型,开源即刷新世界纪录
从Sora惊艳亮相到谷歌开放Genie 3线上体验,世界模型从概念走向交互世界。蚂蚁旗下蚂蚁灵波开源全球首个视频 - 动作世界模型LingBot - VA,可驱动机器人完成复杂操作,解决长时漂移等问题,还提出工程化解法。
告别Transformer,重塑机器学习范式:上海交大首个「类人脑」大模型诞生
上海交通大学团队发布首个「类人脑」大模型 BriLLM,脱离传统 Transformer 架构限制。它基于 SiFu 学习机制,有可解释性、能无限处理上下文等优势,还支持多模态融合,已获交大重点项目资助。
从诡异视频到假论文,AI正把互联网变成巨型「垃圾场」
AI生成的诡异视频在社交平台流行,如比基尼胖女人跳水、食物自相残“食”等,背后是流量逻辑和低成本创作。更严重的是,AI生成的低质量论文渗透到学术领域,危害知识纯粹性和科研公正性。