L20 GPU」共找到 834 篇相关文章

产品应用7

【CUDA 博客】TMA简介 & 让矩阵转置在Hopper GPUs上变得更快

文章介绍Hopper GPU新特性TMA,它能高效传输多维数组数据。文中展示用TMA对2D数组操作,如创建张量映射、编写kernel等。还讲了避免共享内存bank冲突的交织方法,最后介绍在Hopper GPU上实现高效矩阵转置的多种方式及性能。

GiantPandaLLM
产品应用7

748GB内存、20P算力,英伟达把数据中心塞进了桌子底下,第一台已经送到Karpathy家里

英伟达DGX Station GB300首批系统交付开发者,首台给了Andrej Karpathy。它有748GB内存、20P算力,用GB300芯片架构。背后是长时运行自主智能体开发需本地算力,英伟达从软硬层面推进。

AI寒武纪
新闻资讯7

算力租赁要变天了

去年华尔街就算力巨头折旧问题起争议,大空头Michael Burry称其通过延长AI服务器折旧周期虚增利润。随着英伟达GPU迭代周期缩短,折旧时间应缩短。Coreweave靠出租GPU盈利,以其为抵押物的巨额贷款引发争议。Meta出租闲置算力或冲击Coreweave等公司。

远川科技评论
新闻资讯8

蚂蚁集团领投,光轮智能20亿美元估值引领全球具身数据基础设施|甲子光年

具身智能市场逻辑生变,从关注模型和本体转向数据与评测基础设施。光轮智能获蚂蚁集团领投,估值超20亿美元。其构建完整闭环,参与国际标准制定,打造物理AI教育系统,引领产业发展。

甲子光年
开源动态8

源神阿里!图像生成Ovis-Image再开源,7B小参数媲美GPT-4o和20B开源模型

阿里Ovis团队发布Ovis - Image,7B参数文本到图像模型,在文本渲染任务媲美GPT - 4o和20B + 开源模型。它架构优化、数据工程精细、训练范式独特,实测数据表现佳,显存占用低、推理快。

AIGC开放社区
开源动态8

小米模型实现声音理解新SOTA!数据吞吐效率暴增20倍,推理速度快4倍 | 全量开源

小米全量开源MiDashengLM - 7B模型,它基于Xiaomi Dasheng和Qwen2.5 - Omni - 7B Thinker,实现声音理解新SOTA。性能领先,推理效率高,革新训练范式,全栈开源,将赋能多场景。

量子位
算法论文8

全新GPU高速互联设计,为大模型训练降本增效!北大/阶跃/曦智提出新一代高带宽域架构

随着大模型参数规模扩大,分布式训练成关键路径,高带宽域设计对提升训练效率至关重要。现有HBD架构在可扩展性、成本和容错能力等方面有局限,北大、阶跃、曦智团队提出InfiniteHBD架构解决问题。

量子位
产品应用8

3 亿美元 ARR、估值超 20 亿美元,演语科技是怎么做 ToC 应用增长的?

AI应用难做,演语科技却完成近3亿美元B+轮融资,估值超20亿美元,ARR超3亿美元。其成功在于找准付费人群、做厚应用、激进增长,让产品功能转化为收入,为AI应用商业化提供范例。

Founder Park
新闻资讯7

安谋科技“开源AIOS联盟”亮相WAIC2026:20+家产学研伙伴已锁定,协力布局AI产品“芯"基建

7月18日,安谋科技在2026世界人工智能大会宣布发起“开源AIOS联盟”,超20家生态伙伴入驻,涵盖产学研全链路。联盟围绕技术研发等发力,推动AIOS在新兴智能终端落地。

芯师爷
新闻资讯7

Grok 4基准测试被爆极其优异,人类终极考试成绩飙升到45%,碾压o3 和Gemini的20%

API开发者曝光Grok - 4和Grok - 4 Code测试成绩,HLE达35%,推理后飙升到45%,远超o3和Gemini的20%。其他测试也表现优异,但成绩引发争议,有人质疑数据污染,也有人支持,目前数据未官方证实。

AGI Hunt