「根因分析」共找到 2230 篇相关文章
MOE RL实战:统一FP8全流程训练
SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。
马斯克、奥特曼X上再开撕,Ilya最新52页证词曝光,抖出OpenAI更多内幕
马斯克、奥特曼又在 X 上开撕,奥特曼因 Tesla Roadster 退款问题与马斯克起争执,马斯克旧事重提指责奥特曼偷非营利组织。同时,Ilya 52 页证词曝光,抖出 Sam Altman 被解雇内幕、备忘录依赖二手信息等 OpenAI 更多内幕。
创始人强塞AI代码,致开源社区分裂!核心开发集体出走:“你这种强权压制,让人恶心!”
近期,GZDoom 背后的开源社区因创始人兼维护者 Graf Zahl 在代码库中加入未经测试的 AI 生成代码而分裂,抗议者创建了分支 UZDoom。Graf 称只是用 AI 生成样板代码,不影响核心功能,但社区成员认为开源项目不该用 AI 工具。
郭台铭,重回首富宝座
曾经放言“给大陆赏饭吃”的郭台铭,因工业富联市值突破万亿,再次被大陆资本市场推上中国台湾首富宝座。工业富联在AI算力基础设施领域表现抢眼,其AI服务器业务成增长主力。郭台铭海外投资受挫后回归内地,推动公司转型。
DeepSeek一句话让国产芯片集体暴涨!背后的UE8M0 FP8到底是个啥
DeepSeek V3.1发布后,官方留言提及新架构和下一代国产芯片,引发AI圈轰动,国产芯片企业股价上涨。文章介绍了UE8M0 FP8概念,分析其适配国产芯片原因,还猜测适配的芯片厂商,指出代表国产AI走向软硬协同。
一个上海AI独角兽爆发了
全球AI圈因MiniMax“发布周”沸腾。新模型MiniMax - M1被视为“性价比新王”,还有新视频、语音模型表现出色。其89年博士闫俊杰带队,在大模型研发上多次做非共识选择,现估值超30亿美元,还推出智能体产品。
别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练
CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致后训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。
大模型的价格战,打到硅谷了
今年夏天,AI价格战风向改变,OpenAI酝酿降价从Anthropic抢客户。7月,Anthropic推半价平替Claude Opus 5,此前OpenAI发布GPT - 5.6打性价比。价格战因大模型购买逻辑变化、头部差距难支撑溢价等引发,虽让应用层受益,但对模型公司是资本耐力赛。
5秒出4张2K大图!阿里提出2步生成方案,拉爆AI生图进度条
阿里智能引擎团队针对Qwen最新开源模型,将SOTA压缩水平从80 - 100步前向计算骤降至2步,速度提升40倍,5秒可出4张2K高清大图。已发布Checkpoint,集成到呜哩AI平台。文章还分析传统蒸馏方案问题并介绍团队改进策略。
分享两篇Claude Skills最新论文,有3个核心结论
文章分享两篇Claude Skills最新论文,总结出技能安全漏洞、技能数量与准确率关系等结论。还探讨单智能体技能系统能否取代多智能体,通过实验验证其效率优势,并提出解决技能选择过载的方案,也对Agent Skills做了安全分析。