类R1训练」共找到 2513 篇相关文章

开源动态8

腾讯AngelSlim升级,首个集LLM、VLM及语音多模态为一体的投机采样训练框架,推理速度飙升1.8倍

随着大模型应用成本与延迟问题凸显,腾讯混元升级 AngelSlim 训练框架,将投机采样技术拓展至全模态场景。它以 Eagle3 架构让推理速度最高飙升 1.9 倍,还具全模态训练、面向部署等亮点,有开源代码。

机器之心
算法论文8

10秒视频token超5万,O(n²)跑不动?用后训练线性化框架实现1.71倍加速,推理成本大降|CVPR'2026

视频生成进入大规模时代,但计算成本高,自注意力复杂度O(n²)跑不动。研究团队提出LINVIDEO后训练框架,无需数据和重新预训练,实现视频扩散模型线性化替换,保持生成质量,加速推理并降低成本。

量子位
算法论文8

ICLR 2026 Oral | 西湖大学发布Real PDE Bench

复杂物理系统时空演化预测是核心问题,当前AI模型多在数值仿真数据上训练,难以评估其在真实数据上的表现。西湖大学等实验室提出RealPDEBench,含真实与仿真数据,设三任务、九个评估指标和十个基线方法。

力学与人工智能
开源动态8

媲美DeepSeek!腾讯开源新版混元模型:AI Agent强化,超30种智能体指令

腾讯开源混元大模型最新版本Hunyuan - A13B,为专家混合模型,有800亿参数,130亿激活。支持快慢思考模式,针对AI Agent强化,设计超30种智能体指令。测试成绩超DeepSeek - R1等,架构和训练有优化。

AIGC开放社区
算法论文8

清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026

在医疗AI领域,模型静态评测与临床问诊能力存在断层。清华刘洋团队提出DOCTOR - R1,将临床问诊建模为POMDP,用强化学习训练。实验验证了其有效性,对医疗AI发展有深远启示。

AI科技评论
开源动态8

伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开

开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。

新智元
开源动态7

OpenAI没做到,DeepSeek搞定了!开源引爆推理革命

文章围绕大语言模型推理能力展开,介绍了推理模型概念,回顾RLHF训练流程,对比OpenAI的PPO和DeepSeek的GRPO,还阐述了GRPO开源升级版DAPO的关键技术点及训练中模型的新能力。

新智元
开源动态8

The Batch: 869 | 编码助手的训练数据

研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。

DeeplearningAI
开源动态7

Distilabel DeepSeek-R1 模型蒸馏教程

文章介绍结合distilabel与QLoRA技术定制专属大模型的路径。先用distilabel框架利用DeepSeek - R1生成医疗指令数据集,再用QLoRA技术微调Qwen3 - 4B模型,还给出实战路线图和代码示例。

机器学习AI算法工程
新闻资讯8

突发!OpenAI紧急暂停GPT-6训练

OpenAI奥特曼官宣暂停下一代旗舰模型强化学习训练两周,原因是确保安全等标准跟上能力水平。触发因素有Hugging Face事故和Astra达安全红线,后续将让AI监管AI,加固三道安全防线。

新智元