「多尺度Transformer」共找到 4280 篇相关文章
谢赛宁苏昊CVPR25获奖!华人博士王建元一作拿下最佳论文
CVPR 2025奖项揭晓,谢赛宁、苏昊获青年学者奖。最佳论文《VGGT: Visual Geometry Grounded Transformer》由王建元一作。还介绍了最佳学生论文及4篇荣誉提名论文的亮点与应用前景。
RF-DETR-首个突破60 AP的实时检测器(附实战教程)
RF-DETR在COCO数据集上,实时检测精度首破60 mAP,兼顾实时性与高精度。它通过NAS找到Transformer实时运行的‘最优解’,迭代快,适用于多场景,还给出完整实战教程。
The Batch: 943|液体和气体如何运动
传统数值方法模拟复杂物理系统慢且贵,基于机器学习的模拟通常只适用于特定系统。研究人员构建通用 transformer 模型 Walrus,可模拟流体运动,开源且在多方面表现出色,有望加速多领域模拟工作。
AGI真方向?谷歌证明:智能体在自研世界模型,世界模型is all You Need
谷歌DeepMind研究人员表明,通用AI智能体处理复杂长期任务需学习内部世界模型,还证明可从智能体策略提取该模型。此研究成果补充多领域,对AI发展和安全意义重大。
ICCV 2025 | RobustSplat: 解耦致密化与动态的抗瞬态3DGS三维重建
3DGS技术成研究热点,但现有方法在含动态物体场景建模精度不足。中山大学等研究者提出RobustSplat,有延迟高斯生长和尺度级联掩码引导两大核心设计,实验显示其在多指标上领先基线方法。
Mamba 架构实现推理性能超 Gemma3-27B!推理模型开始迈入「无注意力」时代
PromptCoT - Mamba是首个具解码显存常量等特性且推理能力强的模型。当前推理大模型中注意力机制有局限,PromptCoT - Mamba实现无注意力推理,在多评测集超Transformer等模型,为无注意力推理生态奠基。
OpenAI 迈出关键一步:LLM 黑盒不再是盲盒
OpenAI开源新研究成果,提出全新范式,训练权重稀疏的Transformer模型以提取人类可理解的电路。该方法分三步,关键结果显示稀疏模型优势多,但也存在训练成本高、规模有限等局限,还给出两条未来路线。
高效大规模创新3D重建模型iLRM
多数基于Transformer架构的模型处理多视图输入有可扩展性问题,成均馆大学、延世大学研究人员提出创新3D重建模型iLRM。它通过迭代细化机制生成3D高斯表示,有独特架构设计和高效注意力机制。
Meta没做的,英伟达做了!全新架构吞吐量狂飙6倍,20万亿Token训练
英伟达发布全新架构9B模型NVIDIA Nemotron Nano 2,以Mamba - Transformer混合架构实现推理吞吐量最高提升6倍,对标Qwen3 - 8B并在多任务中表现持平或更优,还开源模型及大部分预训练数据。
ICLR 2026|首个微观世界模型MicroVerse来了,AI开始模拟看不见的世界
过去两年,世界模型成为大模型演进重要方向,但现有模型多聚焦宏观世界。本文提出MicroVerse模拟框架,将研究边界拓展到微观尺度,还推出MicroWorldBench评测基准和MicroSim - 10K数据集,推动AI从视觉模拟迈向科学模拟。