后训练技术」共找到 5930 篇相关文章

开源动态8

补齐OpenClaw进化拼图!AReaL v1.0开源,智能体强化学习「一键接入」

2026 年 Agent 仍是热门赛道,OpenClaw 热度持续。但 Agent 强化学习训练缺乏成熟体系。蚂蚁和清华联合打造的 AReaL v1.0 开源,实现 Agent 一键接入 RL 训练,还革新了训练引擎,降低开发门槛。

机器之心
算法论文8

多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26

多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。

新智元
新闻资讯7

GPT-5 的秘密武器:Universal Verifiers

OpenAI开发「Universal Verifier」(通用验证器)技术助力GPT - 5。该技术让一个AI模型检查另一个模型输出质量,解决了强化学习难题,使GPT - 5在多领域表现出色,不过技术可能因人员流动扩散。

AGI Hunt
算法论文8

Sea AI Lab 揭秘:你费尽心力调的 LLM 一直在崩溃?罪魁祸首可能只是一个参数:BF16

Sea AI Lab 和新加坡国立大学研究指出,强化学习微调中训练不稳定和性能瓶颈,根源是数值精度 BF16。其低精度造成“训练 - 推理不匹配”,使训练易失败。将精度切换到 FP16 可解决问题,提升模型表现。

AI寒武纪
推荐文章7

【访谈】在黑箱中寻找自我显影——对话苏仲尧|三影堂厦门

苏仲尧个展《打开黑箱说亮话》聚焦摄影人机互动,引向对‘技术黑箱’思考。创作分三阶段,从文字照片到金属板,再结合AI。他将创作主导权回归自身,借作品探讨技术与人关系及当下处境。

三影堂摄影艺术中心
开源动态7

OpenAI没做到,DeepSeek搞定了!开源引爆推理革命

文章围绕大语言模型推理能力展开,介绍了推理模型概念,回顾RLHF训练流程,对比OpenAI的PPO和DeepSeek的GRPO,还阐述了GRPO开源升级版DAPO的关键技术点及训练中模型的新能力。

新智元
开源动态8

如何做到在手机上实时跑3D真人数字人?MNN-TaoAvatar开源了!

阿里巴巴淘宝Meta技术团队研发的TaoAvatar技术,能在手机或XR设备实现3D数字人实时渲染与AI对话。今日开源MNN - TaoAvatar应用,可在手机运行,对比主流方案更高效便捷,还介绍其优势、技术及使用说明。

机器之心
算法论文8

Monet:赋予多模态大模型如人类一般的抽象视觉思考能力

文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。

机器之心
推荐文章7

性能最高提升7倍?探究大语言模型推理之缓存优化

文章探讨大语言模型推理缓存优化技术演进与未来展望,介绍了主流推理框架vLLM、SGLang,分析KV Cache、Paged Attention、Prefix Caching等技术的优化点,还提及LMCache、DeepSeek的缓存技术,最提到MCP赋能可视化OLAP智能体应用。

阿里云开发者
新闻资讯7

年入6亿、日本细分赛道第一,国产AI 硬件如何拿下日本智能家居市场?

国产 AI 硬件 SwitchBot 拿下日本智能家居市场市占第一。它单价低、安装灵活,以“非入侵式装”理念,从智能开关拓展到多品类。2023 年扫地机器人 K10+ 大获成功,又用 S10 试水美国市场,还推出 K20+ Pro 拓展场景。

Founder Park