「双阶段训练策略」共找到 3206 篇相关文章
LeCun点赞:国产开源模型占领硅谷,性价比超10倍
硅谷被中国开源模型占领,Cursor、Cognition等公司模型被曝套壳或基于中国开源模型后训练。巨头如Meta也用Qwen做训练,爱彼迎等青睐Qwen。因性价比高,中国开源模型在硅谷走红。
训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式
大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。
Anthropic创始人行动手册:打造一家AI-Native创业公司(附36页中文PDF)
Anthropic上周发布《创始人行动手册》,介绍AI时代打造AI - Native创业公司的方法。手册按创业四阶段展开,阐述各阶段目标、挑战及Claude工具的使用,还给出资源、案例和创业支持信息。
开启RL Scaling新纪元,siiRL开源:完全分布式强化学习框架,支持超千卡规模高效训练
传统强化学习框架在模型和集群规模达上千块GPU时,存在扩展性瓶颈和效率低下问题。上海创智学院团队推出siiRL,采用全分布式架构和多控制器范式,解决传统框架痛点,在多方面验证了其高性能。
马斯克开始疯狂剧透Grok 5了
ARC - AGI榜单官宣新SOTA,用Grok 4+程序合成技术微调,超越一众明星模型。马斯克剧透Grok 5,称其能达AGI,将几周内开始训练。投入大量训练数据和硬件资源,但成品效果仍待观察。
AI能自己打红警了!经济拉满零交战惨遭打脸,玩家笑疯
Hugging Face推出OpenRA-RL,将《红色警戒》改造成大模型的Agent训练场,50个MCP游戏工具全量暴露,25Hz实时状态流推送,打通三条训练路线,原生接入OpenEnv生态。实战中,Agent经济满分但战斗零分。
构建一个 Agent 只要三分钟,但为什么大多数企业的 Agent 还停留在 Demo 阶段?
文章以 Google Cloud 开发者大会演示引出问题:构建 Agent 仅需几分钟,为何多数企业的 Agent 还停留在 Demo 阶段?指出这背后是治理、运行时等一连串工程挑战的叠加,还介绍了 Google Cloud 相关解决方案。
X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习
年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。
关键突破:理论验证了 RL for LLM 路线的可行性
传统RLHF依赖人工标注偏好数据训练奖励模型,成本高且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可高效实现模型对齐。
8 个月做到 1 亿美元 ARR,Lovable 增长负责人:免费用户不是成本,是营销渠道
Lovable增长负责人Elena Verna分享产品增长经验,指出增长团队核心是解决分发问题,PLG概念被过度炒作,传统增长策略失效,应把免费产品当营销预算,还给出未来增长的8个关键策略。