「GPU训练」共找到 2452 篇相关文章
第一视角效率超过真机,深度机智发布全球首个以人类学习范式构建的具身基座模型
2026年具身智能行业火热,但技术路线不明。深度机智创始人陈凯在中关村论坛发布具身智能基座模型PhysBrain 1.0,用千余小时人类第一视角数据超越真机数万小时数据成果,开启具身领域‘物理常识’革命。
多模态Qwen3-VL-Embedding开源&技术剖析
互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。
字节跳动发布SeedFold,蛋白质结构预测相关多任务超越谷歌AlphaFold 3,揭示大模型缩放新秘诀
字节跳动Seed团队推出新一代折叠模型SeedFold,在多个蛋白质相关任务性能上超越谷歌AlphaFold 3。该研究为有效缩放生物分子基础模型提供新思路,推出加宽模型、线性三角注意力等方法。
跳出「黑盒」,人大刘勇团队最新大语言模型理论与机理综述
大语言模型工程成功但理论研究滞后,被视为「黑盒」。人大刘勇团队用生命周期分类法,将LLM理论研究整合为六阶段,系统综述底层理论与机制,指出前沿挑战,为其向严谨科学转型提供路线图。
李飞飞又被超越了?百万「普通视频」打造通用4D世界模型!
全行业为昂贵多视角数据发愁时,中科院和CreateAI推出NeoVerse,用百万单目视频打开4D世界模型大门。它抛弃多视角数据和离线预处理,解决扩展性瓶颈,在重建速度、生成质量等方面表现出色,有丰富下游应用。
港大联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型
香港大学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。
后生可畏!何恺明团队新成果发布,共一清华姚班大二在读
何恺明团队继5月提出MeanFlow (MF) 后,近日推出改进版Improved MeanFlow (iMF),解决了原始MF三大核心问题。它重构预测函数,还实现灵活的无分类器指导和高效的上下文内条件作用架构,提升了实用性和效率。
小米打通智驾和具身大模型,然后开源了
小米汽车陈龙团队开源全球首个跨具身基座模型MiMo - Embodied,基于MiMo - VL架构,采用四阶段训练策略,打破室内操作与户外驾驶领域鸿沟,在29个Benchmark上超现有模型。
单卡跑出集群效率!Hugging Face TRL 与 RapidFire AI 的超并行革命
Hugging Face宣布其核心微调库TRL集成RapidFire AI,重构大模型后训练阶段工作流。RapidFire引入超并行实验引擎,提升实验验证速度,解决算力受限团队的调参难题,带来效能质变。
芯片就像重庆,英特尔说的
英特尔中国区董事长王稚聪将芯片比作重庆,称其城市规划与芯片剖面图相似。在重庆举办的大会上,英特尔展示新意,如18A工艺制程等,还在端侧和数据中心领域提出新观点与合作成果。