「两阶段流程」共找到 2002 篇相关文章
Codex正在重塑传统推理框架开发流程
作者用Codex完善SGLang Diffusion的SKILLS流程,修复诸多bug。让其做benchmark脚本,发现不同rmsnorm性能差异。应用flashinfer rmsnorm遇问题,Codex找出原因并修复,还提升了模型性能,体现强大生产力。
突发!OpenAI停止强化学习训练两周
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
MoE RL 实战:统一 FP8 全流程训练
SGLang RL 团队等实现 RL 全流程 FP8 训练与采样,消除训推不一致性。介绍 FP8 硬件基础、格式等,分析训练难点,定位 KL Loss 异常源于量化原理,验证其在 MoE 模型 RL 场景优势,指出模型规模与训推不一致的关联。
MOE RL实战:统一FP8全流程训练
SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。
诺奖得主刚走,Gemini两大核心叛逃Anthropic!
谷歌人才流失严重,一周内五名顶级研究员出走,Gemini两大核心将入职Anthropic。同时,Gemini 3.5 Pro延期至7月。Alphabet股价下跌,市值蒸发超2000亿美元。原因或是上市期权诱惑和算力分配问题。
百度 TURA 三阶段架构:让 AI 检索 “动” 起来
现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户实时数据需求。百度 TURA 架构用工具调用将 RAG 升级为动态交互,分检索、规划、执行三阶段,已在百度亿级流量场景跑通。
连续发布两款万亿参数模型,蚂蚁 AI 来势汹汹
国庆期间大模型行业热闹非凡,各团队产品侧重不同。蚂蚁百灵大模型团队在十天内连续发布并开源两款万亿参数模型 Ling-1T 和 Ring-1T-preview,引发关注。万亿参数模型难训,国内达到此规模的屈指可数。Ling-1T 综合性能出色,应用场景广泛。蚂蚁选择开源,意在构建开放 AGI 生态。
抢完诺奖得主又挖伯克利CS掌门,Anthropic两周揽四将
AI人才抢夺战升级,Anthropic两周揽四将,包括诺奖得主John Jumper等。7月1日,UC伯克利计算机科学部掌门人Jelani Nelson加入Anthropic。当下AI竞争从模型能力转向算法理论,‘休假入职’成潮流。
2026,做Agentic AI,绕不开这两篇开年综述
2026年Agent迈入科研&落地深水区,推荐两篇开年必读综述。一篇剖析Agentic AI范式演进与挑战,另一篇拆解AI Agent系统架构,还给出范式演化、工程骨架等内容及未来科研优先级。
近期,谷歌发了两篇Agent Scaling论文,有点东西
2025年LLM社区有Test - Time Scaling和Agent化两条主线,但‘更多agent是否更好’无人能定量回答。谷歌两篇论文将agent scaling拆成可预测、可度量的科学问题,涉及预算感知和多agent盈亏平衡点。