「统一自回归」共找到 1630 篇相关文章
谷歌卷土重来:你大爷还是你大爷
上周谷歌横扫科技媒体头条,英伟达官方X账号点赞谷歌TPU成绩后话锋一转称自家产品领先。此前有传闻Meta考虑换用谷歌TPU,消息致英伟达市值蒸发、谷歌市值上涨。今年谷歌发布Gemini - 3系列模型,其自研芯片TPU引发关注。
百芯竞逐,芯片产业的“新战国时代”
ASIC发展超预期,成AI竞争胜负手。它适配大厂专属需求,成本与功耗低,出货量和市场规模将扩容。英伟达GPU虽难替代,但份额会被ASIC蚕食,谷歌TPU已撕开其垄断裂缝,大厂纷纷自研ASIC。
万帧实时!流式3D重建天花板,被国产开源模型打破了
蚂蚁正式开源 LingBot-Map,这是基于几何上下文 Transformer 的纯自回归流式 3D 重建基础模型。它能在恒定内存下实现超万帧长视频实时三维重建,处理速度约 20 FPS,在多基准测试中超越现有流式方法。
华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」
今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。
设计师大解放!清华发布「建筑平面图」自动生成模型 | ACL'25
清华大学吕帅团队提出FloorPlan-LLaMa模型,采用自回归生成架构与RLHF机制,解决传统平面图自动生成模型‘指标优秀但实际不可用’痛点,提升生成式平面图设计质量与实用价值。该论文被ACL录用获领域主席奖。
其实,扩散语言模型在最终解码之前很久,就已确定最终答案
随着扩散语言模型(DLM)发展,它成自回归(AR)模型有力替代。但实际推理慢于 AR 模型。研究者发现早期答案收敛现象,提出 Prophet 策略,实验显示其能在保持高质量生成时显著加速推理。
视觉Token注入CLIP语义,走向多模态理解与生成新范式
腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。
推理速度飙升5倍,苹果提出全新Multi-Token生成框架!
自回归语言模型逐词生成文本拖慢推理速度、限制并行能力。Apple提出全新框架,挖掘其对未来词元“先验知识”,通过多项技术并行预测多词元,微调预训练模型可显著提速且不损输出质量。
英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速
多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。
腾讯开源混元世界模型1.1,视频秒变3D世界,单卡推理仅需1秒
腾讯发布并开源混元世界模型1.1,是统一的端到端3D重建基座大模型。它支持从多视图或视频一键生成3D世界,单卡秒级推理完成高精度重建,性能达SOTA,还具多特性,打破技术壁垒。