GPU内核算法」共找到 1007 篇相关文章

算法论文7

上交大和辉羲把LLM刻进ROM!推理性能冲2万token/s,GPU时代终结?

硅谷Taalas将大模型‘物理焊死’进芯片引关注,而上海交大、辉羲智能与微软亚洲研究院团队用ROM+SRAM异构架构,将端侧LLM推理速度推至20,000 tokens/s。介绍了ROMA和TOM架构优势及应用场景。

新智元
新闻资讯8

黄仁勋CES回应全场!内存卡了GPU脖子,游戏玩家可能只能用旧显卡了

在CES 2026上,黄仁勋围绕物理AI发言,涉及机器人、自动驾驶等。他预计今年有类人机器人,推出自动驾驶模型Alpamayo 1。因内存成本和供应问题,或复产旧显卡,还谈了AI对游戏影响及内存规划等。

量子位
开源动态8

华为开源突破性技术Flex:ai,AI算力效率直升30%,GPU、NPU一起用

11月21日,华为发布AI容器技术Flex:ai并联合高校将其开源。该技术基于Kubernetes构建,有三大核心突破,能提升算力利用率,异构兼容性优于Run:ai,将推动国产算力应用。

机器之心
新闻资讯7

哈佛CS博士月入4000,抢GPU搞科研!硅谷百万年薪挖人,学界疯狂逃离

AI人才大战使学术界陷入危机,博士生津贴低、抢显卡搞科研,面对硅谷百万年薪和大厂千亿算力投入诱惑,加速流向产业。教授担心学生跳槽,高校补救难,产业还推出“折中方案”,学术界考验才刚开始。

新智元
算法论文8

无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention

高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。

机器之心
新闻资讯7

倒卖英伟达GPU算力比火箭卫星来钱快!马斯克交出SpaceX首份财报

SpaceX交出首份上市后财报,AI业务收入25.61亿美元同比猛增247%,成第二大收入源。不过AI业务支出158.28亿美元是烧钱大头,业务仍亏损,未来盈利面临客户消化力等问题。

量子位
算法论文8

字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限

强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。

量子位
新闻资讯8

马斯克20亿送Grok 4上火星!20万GPU造宇宙大脑,一句话生成3D黑洞

发布72小时,Grok 4爆红硅谷,2分钟可部署游戏,一句话直出完整动画。xAI成立两周年,马斯克SpaceX将投20亿,或把模型送上火星。Grok 4算力强,多项基准测试刷新SOTA。

新智元
新闻资讯7

亚马逊CEO全员信曝光,硅谷AI裁员潮已至!年薪50万湾区HR被算法淘汰

亚马逊CEO全员信曝光,证实硅谷AI裁员潮来临。如45岁湾区HR、年薪15万美元全栈工程师被裁,谷歌鼓励员工自愿「买断」,2025届大学生就业也因AI变艰难。

新智元
推荐文章8

揭秘千卡 GPU 集群如何高效训练多模态大模型:vivo AI 团队实战经验分享|AICon

在 InfoQ 举办的 AICon 大会上,vivo AI 架构师王兆雄分享多模态大模型训练经验。介绍了 LLaVA 和 DiT 模型训练挑战,从数据处理、模型计算等方面提出优化策略,还展望 AI Infra 未来发展方向。

AI前线