「训练方法升级」共找到 4047 篇相关文章
超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发
斯坦福、伯克利与英伟达联手打造LLM-as-a-Verifier验证框架,该方法是通用验证机制,可与任意Agent Harness和模型结合。研究表明扩展验证阶段计算量,能提升Agent整体性能,在多基准测试中超越Claude Mythos和GPT - 5.5。
马斯克暴走官宣:Grok 5就是AGI!五月连轰两代万亿怪兽,OpenAI慌了
马斯克宣称Grok 5就是AGI,5月将连发1T和1.5T两代万亿参数模型。Grok 4.3已上线,4.4、4.5将相继推出,Grok 5正以6万亿参数规模训练。不过,参数能否堆出AGI存争议。
Life of a Token:像调试代码一样看懂大模型如何生成 Token
文章类比 Chrome 的 Life of a Pixel,追踪 LLM 里 token 从输入到输出的全程。以 GPT - 2 Small 为例,详细讲解其管线各阶段,如 Tokenization、Embedding 等,还介绍了残差流、KV Cache 等概念及 GPU 性能瓶颈和优化方法。
AI 原生软件工程的可观测性与可控制性
文章指出 AI 成研发主力军,改变软件生产方式,传统研发管理办法需升级。当前人和 AI 协作有诸多问题,介绍了研发三阶段,阐述可观测性与可控制性概念、关键指标,以及实现可控制性的要素,强调二者结合构建高效研发体系。
ICLR2026|东方理工大学、上海交通大学等:GenSR:把“离散的公式搜索”变成“连续的地图寻优”
符号回归(SR)目标是从观测数据自动发现数学表达式,但经典方法在离散方程空间搜索有局限。东方理工与上海交大团队提出GenSR,将方程世界重参数化为连续隐空间,用双分支CVAE构造并搜索,实验效果良好。
GLM-5正式发布,744B参数,对标Claude
GLM-5正式发布,对标Claude,参数从355B扩至744B,预训练数据增加。采用GlmMoeDsa架构,部署成本降低。数据表现佳,在多测试中成绩亮眼,还能直输Office文档,部署支持多框架和国产芯片,早期反馈积极。
品味 + 工程思维:AI 时代最难被替代的两件事
AI 时代,最难被替代的是做选择的品味和把结果做稳的工程思维。语法可交 AI,但需有工程思维,它能让使用者把 AI 用好,避免错误和复杂度失控。文章介绍了培养工程思维的方法。
当每个人都能指挥一支 AI 大军,什么能力最重要?
文章指出,在AI Agent增多的时代,管理能力是驾驭它们的关键。沃顿商学院教授提出判断是否委派任务给AI的公式,还建议从更好的指令、评估、反馈三方面提高成功率,同时给出委托任务和锻炼管理能力的方法。
再见了, OpenAI!三年老用户忍痛卸载ChatGPT
从ChatGPT惊艳问世到如今广告缠身,OpenAI乌托邦梦碎!谷歌和Anthropic强势反扑,达沃斯论坛上互怼升级。OpenAI在AI大战中似已落后,还面临马斯克诉讼、巨额算力承诺等问题。不过投资人认为4家AI巨头终将平安落地。
极简RL新范式:一半算力刷新1.5B模型推理SOTA
过去为提升中小参数量模型推理能力,开发者构建复杂RL流水线。JustRL论文提出极简、单阶段、固定超参训练方案,在两主流1.5B模型上刷新SOTA,节省2倍算力,消融实验还揭示部分技巧会致性能退化。