「视频稀疏注意力」共找到 1237 篇相关文章
LightX2V Ulysses Attention 实现学习笔记
本文记录了LightX2V中Ulysses Attention的实现方式与张量形状推导。在多模态/视频场景,其实现可概括为一种layout变换,还提供`enable_head_parallel`和`use_fp8_comm`选项,效果受运行环境等因素影响。
“不是...而是...”刷屏的一年,我读内容的快乐被AI偷走了。
作者补完《怪奇物语》后看B站解说视频,因文案中“不是...而是...”句式不适,由此探讨人们讨厌AI生成内容的原因,指出其像新时代八股文,还提及全球对AI内容的不信任,呼吁保持与他人的真实连接。
LeCun亲自出镜打脸质疑者!憋了20年的AI世界模型,终于爆发了
LeCun亲自出镜介绍V-JEPA 2新进展,目标是开发改变AI与物理世界交互的世界模型。V-JEPA 2基于视频训练,有两阶段训练细节,能用于机器人规划,Meta还发布三个基准测试,后续将研究分层和多模态JEPA模型。
10 天 3000 元,一人造出全球 AI 爆款!好莱坞导演抢人、游戏版引爆期待,合作细节首次披露
中国 29 岁中专毕业的 AI 视频创作者 Mx - Shell 用 10 天、3000 元成本做出 AI 短片《丧尸清道夫》爆火,海外 CEO 隔空递 offer。短片将推大银幕版,游戏版也在制作。Yoroll 创始人谈 AI 互动游戏赛道玩法、商业化等问题。
华人学生立大功!新王Mamba-3直击Transformer死穴,推理效率碾压7倍
新一代开源架构Mamba-3发布,由CMU普林斯顿原班人马打造,15亿参数性能比Transformer高4%,长序列任务端到端延迟仅为其七分之一。它采用新设计哲学,推理优先,有三大核心技术,还能与自注意力层混合提升检索能力。
架构彻底重构!DeepSeek新模型代码曝光,要来的V4让国内外都坐不住了?
DeepSeek官方GitHub代码库曝光代号“MODEL1”新模型线索,或为V4内部代号。代码显示其有重大架构变更,能并行处理稀疏与稠密计算,适配英伟达新架构。此前R1发布推动中国AI开源生态发展,新模型备受期待。
FlashAttention 完全进化史:FA-4 发布之际的技术全景回顾
文章围绕FlashAttention展开,从Attention性能瓶颈引出问题,阐述其各版本演进。FA-1实现算法突破,避免O(N²)内存;FA-2适配架构,提升性能;FA-3深度协同,实现异步;FA-4探索更深异步和角色分工。还探讨跨芯片迁移及未来优化方向。
腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实
腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。
斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4
斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。
Nano-Banana 核心团队分享:文字渲染能力才是图像模型的关键指标
谷歌新发布的图像生成与编辑模型Gemini 2.5 Flash Image(Nano - Banana)热度超Grok视频生成。文章通过团队访谈,介绍其图像创作新方式、文字渲染代理指标、交错生成能力等,还对比了与Imagen差异,展望AI终极形态。