后训练算法」共找到 4113 篇相关文章

算法论文8

告别「利用率崩溃」:GIPO开启大模型强化学习高效训练新方法 | ICML 2026

树根科技与三一集团团队联合提出 GIPO 算法,在机器人操控及大语言/视觉动作模型强化学习训练中,缓解了策略滞痛点,改善了 PPO 硬截断引发的‘利用率崩溃’问题。介绍了 GIPO 算法原理、优势及实验结果。

AI科技大本营
开源动态8

史上最大高质量科学推理训练数据集开源,快速让Qwen3等变“科学家”

上海创智学院、上海交通大学发布开源科学推理训练数据集MegaScience,含约125万条问答对,覆盖多学科。它解决了现有数据集的问题,实验显示能提升模型科学推理能力,已完整开源相关组件。

量子位
算法论文8

Agent RL 总是训练崩?UCLA 这篇论文给了救命稻草!

这篇解读UCLA和威斯康星大学麦迪逊分校论文《ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning》的文章指出,Agent RL训练易崩溃,原因在于多轮交互任务带来奖励稀疏等问题。论文建“竞技场”,提出SAMPO算法提升稳定性,还给出从业者建议。

深度学习自然语言处理
新闻资讯7

梅西投了李飞飞,她转身买下了一家机器人“训练场”

足球巨星梅西旗下体育科技投资平台 Play Time 投资了李飞飞的空间智能企业 World Labs。该公司今年 2 月获 10 亿美元融资收购了 SceniX,以补足其机器人仿真短板。此前,Marble 虽能搭建训练场景,但没掌握物理规律。

InfoQ
产品应用8

模型训练篇|多阶段ToolRL打造更可靠的AI导购助手

当前,AI导购成电商与服务平台新风口,但芝麻租赁场景挑战大,存在需求难匹配等痛点。为此打造AI导购智能体“租赁小不懂”,经架构升级和算法优化,性能提升,还探索了MoE训练和推理优化。

阿里云开发者
新闻资讯7

刚刚,DeepSeek最新发文!V3/R1训练细节全公开,信息量巨大

网信办新规生效,DeepSeek回应,标注AI生成内容,公开V3/R1训练细节。介绍训练分预训练和优化训练,深挖数据使用,还谈及推理、开源情况,也提到对抗AI幻觉与滥用风险的措施。

新智元
算法论文8

集成20+先进算法,优于GPT-4o,自主因果分析智能体来了

加利福尼亚大学圣迭戈分校研究团队提出自主因果分析智能体 Causal - Copilot,集成超 20 种算法。它解决因果分析使用门槛高、预训练模型有局限等问题,性能优于 GPT - 4o ,已开源邀全球研究者参与。

机器之心
算法论文7

不平衡数据下对比学习的理论分析:从训练动态到剪枝解决方案

本文第一作者为新泽西理工学院廖海旭。对比学习在类别不平衡数据下面临挑战,此前研究未考虑其影响。本文构建理论框架刻画训练动态,定量分析少数特征影响,提出剪枝算法增强少数特征学习,实验验证其有效性。

机器之心
新闻资讯7

OpenAI华人AI大牛集体跳槽Meta!清华北大浙大中科大校友各一位,多模态训练、感知团队负责人全走了

扎克伯格从奥特曼手里挖走4名OpenAI华人顶尖AI人才,包括中科大、浙大、清华、北大校友各一位。OpenAI或提高薪酬留人,人才争夺战成本升高,这也是开源与闭源阵营的交锋。

量子位
新闻资讯8

GPT-5≈o3.1!OpenAI首次详解思考机制:RL+预训练才是AGI正道

OpenAI研究副总裁Jerry Tworek在播客访谈中称,GPT-5类似o3.1。他详解模型推理过程,强调RL+预训练是AGI正道,肯定DeepSeek的GRPO算法,还分享自身经历及OpenAI工作结构。

量子位