「整流流Transformer」共找到 386 篇相关文章
世界首个「实时、无限」扩散视频生成模型,Karpathy投资站台
Decart发布世界首个「实时、无限」扩散视频模型MirageLSD,输入视频流能快速转化画面,前特斯拉AI总监Karpathy投资。它在时长和延迟上有突破,也有需改进之处。
实时生成视频!StreamDiT每秒16帧,单卡生成
现有文本生成视频模型多为离线生成,无法满足实时交互需求。加利福尼亚大学与Meta联合提出StreamDiT模型,采用流匹配等方法,蒸馏模型可单卡每秒16帧实时生成512p视频,不过仍有伪影问题。
Mamba 架构实现推理性能超 Gemma3-27B!推理模型开始迈入「无注意力」时代
PromptCoT - Mamba是首个具解码显存常量等特性且推理能力强的模型。当前推理大模型中注意力机制有局限,PromptCoT - Mamba实现无注意力推理,在多评测集超Transformer等模型,为无注意力推理生态奠基。
十三年布局,一朝反超!谷歌AI崛起的真实故事
2025年谷歌多款AI成果表现亮眼,如Nano Banana登顶、Gemini App下载量第一、Gemini 3超ChatGPT。这场逆袭始于2012年太浩湖竞拍,之后谷歌收购DeepMind、发明Transformer、自研TPU芯片,虽历经波折,终在2025年反超。
NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型
NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。
微调重要表征以增强思维链的推理能力
团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数量低,还适应少样本场景。
OpenAI 迈出关键一步:LLM 黑盒不再是盲盒
OpenAI开源新研究成果,提出全新范式,训练权重稀疏的Transformer模型以提取人类可理解的电路。该方法分三步,关键结果显示稀疏模型优势多,但也存在训练成本高、规模有限等局限,还给出两条未来路线。
苹果掀桌!扔掉AlphaFold核心模块,开启蛋白折叠「生成式AI」时代
蛋白质折叠是计算生物学核心难题,SimpleFold作为首个仅基于通用Transformer模块的蛋白折叠模型,摒弃AlphaFold2系列传统架构,能将蛋白序列生成三维原子结构,在多基准测试表现强劲,还可生成结构集合。
博士宿舍激情脑暴,革新了Scaling Law?Qwen和浙大联手推出新定律,直接干掉95.5%推理内存!
近日,阿里与浙大合作提出并行计算缩放定律 ParScale,可在不增参数下提升大模型能力,推理效率更高。它通过引入并行流实现,在数学、编程等任务表现佳,适合边缘设备,代码已开源。
谷歌192亿买他回来,现在只想让他闭嘴
谷歌花27亿美元挖来的Transformer“贡献最大”作者Noam Shazzer,因在公司内部论坛发表极具争议的言论,点燃“火药桶”。谷歌管理方删帖使争议升级,外界联想起2017年“James Damore事件”,但Noam地位重要,谷歌难以将其开除。