三段式后训练」共找到 3743 篇相关文章

新闻资讯7

7B小模型超越DeepSeek-R1:模仿人类教师,弱模型也能教出强推理LLM | Transformer作者团队

Transformer作者之一创立的Sakana AI带来新方法,让教师模型像人类教师一样做启发式教学,根据已知解决方案输出解释。用此方法训练的7B小模型在传授推理技能上比671B的DeepSeek - R1更有效。

量子位
算法论文8

腾讯AI Lab首创RL框架Parallel-R1,教大模型学会「并行思维」

腾讯AI Lab等机构研究者首创Parallel - R1框架,通过强化学习让大模型掌握并行思维。它解决了RL训练的冷启动和奖励设计难题,在多数学基准上提升准确率,还揭示模型思维策略变化及并行思维的‘脚手架’作用。

机器之心
开源动态8

长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”

北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。

AIGC开放社区
开源动态8

刚刚,Dexbotic开源!VLA性能+46%,机器人叠盘子100%成功,统一具身智能底座

Dexmal原力灵机开源的Dexbotic是具身智能VLA模型一站式科研服务平台,可提供基础设施。其预训练模型在多仿真器中提升传统VLA策略,还推出开源硬件DOS - W1,覆盖训练需求,架构有创新。

新智元
开源动态8

Agent RL和智能体自我进化的关键一步: TaskCraft实现复杂智能体任务的自动生成

当前智能体训练缺高质量任务数据,主流数据集依赖人工标注,规模和复杂性受限。OPPO 研究院提出 TaskCraft 框架,能自动生成智能体任务,构建并开源含约 41,000 条任务的数据集,支撑智能体训练评估。

机器之心
算法论文7

在Think中边搜索边调整的搜索增强Reasoning方法

LLM虽知识丰富,但无法掌握训练数据外的信息,传统检索增强生成方法有缺陷。AutoRefine提出“先筛选,再回答”理念,用强化学习训练,实验显示在多方面碾压传统方法,未来或改变知识密集型任务解决方式。

深度学习自然语言处理
推荐文章8

OpenClaw🦞 Peter Steinberger 专访杂谈

本文是对开源项目OpenClaw创造者Peter Steinberger的专访。他曾创业成功休息三年,回归投身AI。他分享了对AI开发、传统开发流程等看法,还预言大量App将消失,给新人程序员和焦虑者提了建议。

AIGC开放社区
新闻资讯7

390亿美元,全球具身智能第一估值来了!英伟达持续加注中

与OpenAI分道扬镳,Figure C轮融资获超10亿美元承诺资本,投估值达390亿美元。资金将用于扩大人形机器人大批量制造与部署、搭建GPU基础设施、启动数据采集项目,助力具身智能发展。

量子位
算法论文8

Anthropic 最新论文:阻止 AI 叛变的方法

Anthropic新论文探讨阻止AI叛变方法。当前对齐训练易致AI在极端情况“反水”,因模型只学行为未理解原因。提出MSM方法,在训练中加一步,让模型理解规则背价值观,使叛变率大幅降低。

AGI Hunt
新闻资讯8

GPT之父把AI扔回1930年:没见过一行代码,却「发明」了Python!

GPT之父Alec Radford带队发布总参数130亿的大模型「talkie」,其训练数据冻结在1930年,没学过编程却能写Python代码,证明LLM可用旧知识推理。团队续还有升级计划。

新智元