「分布式训练加速库」共找到 2707 篇相关文章
黄仁勋手撕「AI泡沫」论!英伟达570亿铁拳暴击,显卡全断货
英伟达Q3 2026财报显示单季度营收达570亿美元,数据中心业务同比狂涨66%。黄仁勋称AI不是泡沫,而是计算范式从通用CPU转向加速式GPU计算的必然。当前多数AI公司估值高、收入低,英伟达作为‘卖铲人’大获全胜。
英伟达拟 10 亿美元砸向这家 AI 编码创企!Copilot 技术大佬带队、成立两年估值近千亿
10月30日彭博社报道,英伟达拟最高投10亿美元给AI创企Poolside,此轮融资或使其估值翻四倍。该公司由微软技术大佬带队,开发AI编码助手,创建强化学习法训练模型,从底层自研,有独特优势。
NVIDIA港大MIT联合推出Fast-dLLM v2:端到端吞吐量提升2.5倍
自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,端到端吞吐量最高提升 2.5 倍,精度相当。
医疗幻觉率比DeepSeek低3倍,百川循证增强大模型横扫全球医学考试!
百川智能发布首个循证增强医疗大模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率低,多国医考成绩优异,已上线百小应APP并开放API。
突破单token预测局限!南洋理工首次将多token预测引入微调,编程任务准确率提升11.67%
当前主流大语言模型依赖下一token预测训练,难理解跨多token完整概念。南洋理工大学提出概念感知微调(CAFT)技术,首次将多token预测引入微调,能让模型理解完整概念,多领域实验显示其可显著提升模型性能。
新模型亦是新 Agent,Kimi-Researcher 超大量一手实测!
2025 年被称为“Agent 元年”,月之暗面发布了端到端强化学习训练的新一代 Agent 模型 Kimi - Researcher,其基座是自研新模型。文章对其进行大量实测,与 OpenAI 等对比,并探讨了 Deep Research 的重要性及 Kimi 的不足。
少说‘Wait’,多做题:NoWait重塑大模型推理路径
现代大模型在复杂推理时爱用自我反思词,触发冗余验证循环,拖慢速度、增加算力消耗。NoWait方法零训练成本,通过抓关键词、扩展变体、实时屏蔽,让模型跳过废话,在多任务中表现出色,且颠覆对推理的认知。
纯血国产!4B模型越级打怪,杀入万亿赛道
9月1日,Hugging Face上线星火X2.5-4B和1.7B开源端侧模型,在多指标测试中表现优异,实现“越级打怪”。该模型基于全国产算力平台训练,在断网笔记本上实测效果惊艳,使用了两项技术提升能力,适配性强。
芯片团队规模近3000人!小米扩张自研芯片版图
8月24日小米举行玄戒芯片技术沟通会,公布三颗自研芯片:AI旗舰SoC玄戒O3、端侧AI加速芯片玄戒O100、智驾高算力AI芯片玄戒D100。小米重启大芯片研发五年多,投入超210亿,芯片团队近3000人。
名师一定出高徒?清华团队最新揭秘:别再迷信大模型蒸馏的「免费午餐」
当下大模型后训练中,On-Policy Distillation(OPD)成明星技术,业界采用后报告性能提升。但清华团队研究发现,换更强Teacher,Student性能可能无提升甚至倒退。研究揭示蒸馏成败条件,深挖对齐机制,还给出拯救失败蒸馏的方法。