后训练方案」共找到 4388 篇相关文章

算法论文8

Thinking Machine新研究刷屏!结合RL+微调优势,小模型训练更具性价比了

Thinking Machine新研究提出On - Policy Distillation方法,结合RL与微调优势。该方法让学生模型每步由教师模型指导,用KL散度评估分歧。实验表明其训练小模型性价比高,还能解决AI“灾难性遗忘”问题。

量子位
新闻资讯8

专访何佳坤 - 英语高考50分的00体育生,却用AI年销3000万。

本文讲述00体育生何佳坤的外贸创业故事。他高考英语50分,却借助AI做外贸,从大学创业起步,业务不断发展。他将AI用于翻译、售、招聘等各环节,2023 - 2025年营收持续增长,体现AI在打破语言文化差异上的巨大作用。

数字生命卡兹克
新闻资讯7

中际旭创市值6000多亿背:技术卡位,一场“蛇吞象”跨界豪赌

A股“易中天”组合里,中际旭创营收和市值居首。其前身中际装备业绩不佳,66岁创始人王伟修2016年“蛇吞象”收购旭创科技,交棒刘圣。9年营收增180倍,如今稳坐全球光模块厂商第一,还成巨头核心供应商。

芯师爷
算法论文8

刚刚,OpenAI找到控制AI善恶的开关:ChatGPT坏人格在预训练阶段已成型

OpenAI最新论文揭示控制AI“善恶”开关。研究发现训练模型在某领域答错题,会致其在其他领域“学坏”,还找到“毒性人格特征”。同时给出解决办法,能让模型恢复正常。

量子位
推荐文章8

腾讯老兵+大厂00新锐,码上飞想做的不只是AI Coding

HDC 2026上华为展示鸿蒙新能力,背技术服务由创业公司码上飞提供。码上飞核心团队多元,有大厂老兵与02新锐。其技术积累丰富,开源项目多,还参与标准制定和前沿产研。

量子位
开源动态8

超越DeepSeek-R1,英伟达开源新王登顶!14万H100小时训练细节全曝光

英伟达Llama - Nemotron系列模型超越DeepSeek - R1且全部开源。论文揭秘其训练关键,如用合成数据监督微调与强化学习等。还介绍构建阶段、架构设计等,评估显示该系列模型在多任务表现出色。

新智元
算法论文8

训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式

大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。

深度学习自然语言处理
新闻资讯7

LeCun离职不止创一份业!押注与大模型不同的路线,加入硅谷初创董事会

离开Meta,Yann LeCun创立AMI,还加入Logical Intelligence任技术研究委员会主席。该公司推能量 - 推理模型,与主流大模型路线不同,其Kona模型在数独测试上表现远超大模型。

量子位
算法论文8

无需再训练即可增强性能!港大团队提出GPC框架,实现机器人「策略组合」

在机器人学习领域,提升策略性能常需巨额成本。香港大学团队提出GPC框架,通过“策略组合”创造超越单一父策略的“组合策略”,免训练且跨架构、模态融合,经仿真和真机实验验证性能提升。

机器之心
开源动态8

杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火的一切争议

上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。

AI前线