产品应用8
字节ByteRobust系统刷新LLM训练稳定性SOTA
AIGC开放社区
AI 摘要
字节跳动ByteRobust系统专为LLM训练定制,登上SOSP 2025。它通过控制和数据平面组件,实现自动化容错,处理各类故障,在超20万张GPU平台提升训练效率与稳定性,ETTR达97%。
阅读原文 · AIGC开放社区
豆包背后的“超算大脑”:字节ByteRobust系统跑20多万张GPU,性能刷新SOTA
字节跳动自研的ByteRobust系统登上SOSP 2025,部署于超20万张GPU平台,9600张GPU训练三个月ETTR达97%。该系统应对LLM训练故障,由控制和数据平面构成,能自动发现修复故障,提升训练效率与稳定性。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
英伟达首测Vera Rubin,Agent时代格局重写
英伟达公布下一代旗舰级机柜Vera Rubin NVL72片上实测数据,用DeepSeek - V4 - Pro跑任务,每兆瓦吞吐量最高升30倍、Token成本最高降35倍。还宣布Groq 3 LPX量产,推出Agent专属Vera CPU,被SpaceXAI采用。
新智元
新闻资讯8
斯坦福教授直播训练535B大模型
斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去大模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。
机器之心
8
欧洲论文揭三大巨头 AI 安全漏洞
欧洲两位安全研究员的论文《从专有 LLM API 中窃取推理轨迹》爆火。他们揭示 OpenAI、Anthropic 和 Google 用的“无状态架构”有漏洞,能利用小模型解码大模型推理轨迹,导致隐私泄露等风险。
AI科技大本营
开源动态8
腾讯A.I.G:给AI系统做全面安全体检
文章介绍腾讯朱雀实验室开发的AI安全红队测试平台A.I.G,能对AI系统做全面“安全体检”,覆盖AI基础设施、MCP、LLM等风险。它功能实用,安装简单,适合折腾AI服务或MCP的人。
开源先锋