「GPU性能分析」共找到 3176 篇相关文章
分析1.8亿份招聘数据后,他告诉你AI究竟取代了哪些工作
本文分析1.8亿份全球招聘信息,发现AI不是造成大规模失业主因,影响因岗位而异。创意执行类岗位下降多,AI基建岗位增长,程序员、客服、销售较稳定,高层受冲击小,还给出评估岗位安全的建议。
马斯克变身「算力包租公」!砸数万GPU疯狂喂养Cursor,联手反杀OpenAI
马斯克将xAI变成「算力包租公」,租数万GPU给Cursor训练模型,还挖来Cursor高管。同时,特斯拉AI5芯片流片成功,AI6也有规划,Dojo 3项目重启,他正用「硬件思维」重塑AI竞争格局。
一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”
NVIDIA 推出多模态大模型 OmniVinci,结合架构创新与合成数据流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发“假开源”争议。
小扎「梦之队」首批论文上线!LLM自举进化,单步性能狂飙22%
Meta超级实验室MSL新论文探索用强化学习微调大语言模型。提出探索迭代(ExIt)法,基于RL自动课程学习,训练仅需单步任务,模型学会多步自我改进。在MLE - bench上,ExIt相对GRPO提升约22%。
35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源
5月15日上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,尺寸小、科学能力强,在多方面有突破。其深化与昇腾算力生态协同,探索‘通专融合’,科学及智能体能力升级,还优化训推效率。
华为云再掀算力风暴:CloudMatrix384超节点将升级,Tokens服务性能最大可超H20四倍
华为云在全联接大会2025发布新进展,如CloudMatrix超节点升级、首创EMS服务等。其以“算力黑土地”理念,用智算+通算策略满足产业需求,Tokens服务优势显著,还支撑多领域应用。
Nature报道:谷歌新模型1秒读懂DNA变异!首次统一基因组全任务,性能碾压现有模型
谷歌DeepMind团队推出生物模型AlphaGenome,能从1兆碱基DNA序列中预测数千种功能基因组特征,评估变异效应。它统一多任务,性能超现有模型,是生物领域里程碑,将助力理解疾病。
Claude Sonnet 4 上下文翻 5 倍!100 万 token 能处理更大型代码库,AI 代码分析起飞。
Claude Sonnet 4 加入‘百万 token 俱乐部’,上下文容量翻 5 倍达 100 万,能处理大型代码库。不过功能在 Beta 有使用门槛和限制,价格也有变化,还对比了市场上其他模型。
跨芯片统一优化,DLCompiler与DLBlas驱动算子极致表现
9月10日,上海AI实验室DeepLink团队开源DLCompiler和DLBlas。前者是扩展Triton的深度学习编译器,后者是面向大模型的高性能算子库。它们有跨架构DSL扩展等亮点,在多芯片上实现性能优化,还解决了DSA芯片优化难题。
揭秘千卡 GPU 集群如何高效训练多模态大模型:vivo AI 团队实战经验分享|AICon
在 InfoQ 举办的 AICon 大会上,vivo AI 架构师王兆雄分享多模态大模型训练经验。介绍了 LLaVA 和 DiT 模型训练挑战,从数据处理、模型计算等方面提出优化策略,还展望 AI Infra 未来发展方向。