三段式后训练」共找到 3734 篇相关文章

算法论文7

LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!

文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。

AINLPer
开源动态8

Identity-GRPO:阿里开源多人物定制化视频生成的训练优化算法

阿里团队提出Identity - GRPO算法解决多人物视频生成身份一致性问题。构建约15000个标注样本数据集,基于Qwen2.5VL设计奖励模型,多项策略增强训练稳定性,实验验证性能提升显著。

PaperAgent
开源动态8

Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!

Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。

AGI Hunt
算法论文8

10步优化超越强化学习,仅需1条未标注数据!训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型训练提供了更高效简洁的新思路。

新智元
开源动态8

史上最大高质量科学推理训练数据集开源,快速让Qwen3等变“科学家”

上海创智学院、上海交通大学发布开源科学推理训练数据集MegaScience,含约125万条问答对,覆盖多学科。它解决了现有数据集的问题,实验显示能提升模型科学推理能力,已完整开源相关组件。

量子位
新闻资讯7

梅西投了李飞飞,她转身买下了一家机器人“训练场”

足球巨星梅西旗下体育科技投资平台 Play Time 投资了李飞飞的空间智能企业 World Labs。该公司今年 2 月获 10 亿美元融资收购了 SceniX,以补足其机器人仿真短板。此前,Marble 虽能搭建训练场景,但没掌握物理规律。

InfoQ
新闻资讯7

刚刚,DeepSeek最新发文!V3/R1训练细节全公开,信息量巨大

网信办新规生效,DeepSeek回应,标注AI生成内容,公开V3/R1训练细节。介绍训练分预训练和优化训练,深挖数据使用,还谈及推理、开源情况,也提到对抗AI幻觉与滥用风险的措施。

新智元
新闻资讯7

OpenAI华人AI大牛集体跳槽Meta!清华北大浙大中科大校友各一位,多模态训练、感知团队负责人全走了

扎克伯格从奥特曼手里挖走4名OpenAI华人顶尖AI人才,包括中科大、浙大、清华、北大校友各一位。OpenAI或提高薪酬留人,人才争夺战成本升高,这也是开源与闭源阵营的交锋。

量子位
算法论文8

GPU 开始伸手进算法了:摩尔线程要加速 3D 高斯训练 | ECCV 2026

摩尔线程团队论文LiteGS被ECCV 2026接收,旨在加速3DGS训练。它从GPU底层光栅化、数据排列及致密化判断三层改进,进行系统与算法协同设计,开源成果显著。

AI科技评论
新闻资讯7

95,边改造业务边发AI顶会论文,是怎样的体验?

当下AI人才竞争激烈,企业各出奇招。今年5月京东技术沙龙零售专场,技术团队分享成果。几位95青年专家讲述成长历程,如洛川解决CTR模型训练瓶颈,谦屹发表多篇顶会论文。京东还推出人才计划吸引人才。

机器之心