「多阶段训练」共找到 6012 篇相关文章
全国首部可信AI“技术安全+数据合规”标准来了,欢迎参与起草!
2025年国家数据局开展可信数据空间试点,在多领域落地经验。但实践中技术、合规等问题凸显。中国电子商会归口、智合标准中心起草《人工智能大模型可信数据协作安全与合规指南》,有诸多亮点,现公开征集起草单位和起草人。
李飞飞 、 英伟达 Jim Fan 、徐丹飞三巨头联合重磅论文,改写灵巧手触觉赛道
近日,李飞飞、英伟达Jim Fan等顶尖学者联合发表论文《T-Rex: Tactile-Reactive Dexterous Manipulation》。指出过去具身行业在灵巧手触觉的探索方向可能错误,目前加触觉会让机器人变笨,但也给出解决方法,真机实测T-Rex表现优异。
极简RL新范式:一半算力刷新1.5B模型推理SOTA
过去为提升中小参数量模型推理能力,开发者构建复杂RL流水线。JustRL论文提出极简、单阶段、固定超参训练方案,在两主流1.5B模型上刷新SOTA,节省2倍算力,消融实验还揭示部分技巧会致性能退化。
只需1/4预算,性能反超基线:阿里高德提出Tree-GRPO,高效破解智能体RL难题
阿里高德提出Tree - GRPO方法解决智能体RL难题。它以智能体步骤为节点树搜索,在11个数据集中更省预算、表现更好,能在1/4预算超GRPO基线,解决了Rollout成本高和监督稀疏问题。
模仿人类推理修正过程,阶跃星辰提出形式化证明新范式 | 开源
阶跃星辰发布并开源形式化定理证明大模型 StepFun-Prover-Preview-7B 和 32B。采用两阶段监督微调、工具集成强化学习及 RL 与 SFT 迭代循环优化等策略,在基准测试集表现佳,还展示多个证明案例。
10行代码,AIME24/25提高15%!揭秘大模型强化学习熵机制
来自多机构的研究者揭示大模型强化学习中熵变化机制。发现策略熵在训练中急剧下降致性能停滞,提出 Clip - Cov 与 KL - Cov 两种正则化技术调控高协方差标记,遏制熵塌缩,在部分数据集上性能提升显著。
刚刚,阿里发布最强推理模型Qwen3-2507,用疯狂一周暴击美国AI行动计划!
美国发布AI行动计划,欲成“世界AI冠军”,但阿里在7月22 - 25日三连发,推出Qwen3 - 235B非思考版本、Qwen3 - Coder、Qwen3 - 235B - A22B - Thinking - 2507推理模型,冲击美国计划。千问3在多领域表现出色,不过也有使用费用等小问题。
单卡可跑18万原子!分子模拟的“规模焦虑”该终结了
至知创新研究院UBio团队发布的UBio-MolFM v1.5,是可进行分子动力学模拟的机器学习原子间势函数。它在精度和规模上有提升,实测中表现优于经典力场,架构、数据和训练都有创新,误差降45%,速度提8倍,现已开源。
卷进“芯片的窄门”
文章指出国内EDA领域目前实力弱,企业多为“点工具公司”,与美国差距大。但作者对国产EDA乐观,基于中国市场增长快、海外巨头有断供风险、国内竞争未到最激烈时。还分析海外崛起模式及中国困境,提出“特色化整合”路线。
“参考生”之王回归:Vidu Q3持续进化,剧张力拉满|甲子光年
近期,AI视频公司生数科技的Vidu Q3正式上线参考生视频并全面升级。它能解决视频内容创作痛点,让爆款人设等稳定复现。在榜单上表现出色,经测试在多场景降本增效,提升了视频“剧张力”。