三阶段训练」共找到 3254 篇相关文章

产品应用7

消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存

消费级显卡跑大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。

AI工程化
产品应用7

训练世界模型,开始从人类的肌肉和脑子里偷师了

具身智能数据竞争进入新阶段,第一视角视频虽缓解数据量问题,但未记录人行动的原因及大脑身体实时修正。FaceMind提出Ego - NeuroLoop数据范式,配套NeuroMatrix和NeuroBooster,将训练数据从“行为库”推向“闭环库”。

量子位
新闻资讯8

OpenAI公布首颗自研推理芯片成绩,下一代已进入制造阶段

8月25日,OpenAI公布自研推理芯片Jalapeño性能测试结果,首次给出其在多款公开大模型上的具体数据。该芯片在低功耗下实现高推理吞吐量和低延迟,性能超英伟达芯片,B0版已进入制造阶段

DeepTech深科技
开源动态8

英伟达&MIT等推出Long-RL,长视频训练速度翻倍

英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。

机器之心
算法论文8

GPU 开始伸手进算法了:摩尔线程要加速 3D 高斯训练 | ECCV 2026

摩尔线程团队论文LiteGS被ECCV 2026接收,旨在加速3DGS训练。它从GPU底层光栅化、数据排列及致密化判断层改进,进行系统与算法协同设计,开源后成果显著。

AI科技评论
新闻资讯7

Cursor滑跪开源技术报告:Kimi基模这样微调能干翻Claude

Cursor放出Composer 2技术报告力证‘自研’,基于Kimi K2.5经持续预训练和异步强化学习,测试表现好。同时,杨植麟分享Kimi团队最新思考,认为大模型要规模化,断言大模型训练进入第阶段

量子位
算法论文7

AI真的能读懂人心吗?阿里通义最新研究成果揭示答案

文章聚焦多模态推理问题,如全局上下文理解不足和推理捷径问题。介绍阿里通义HumanOmniV2改进方案,涵盖全局上下文理解等方面,还详述冷启动、两阶段强化学习训练方案及数据集下载和训练方法。

CourseAI
开源动态8

最窒息的Bug:Agent循环搜索原地打转?SGR Agent用「双阶段认知」破局

Hybrid Schema - Guided Reasoning(SGR)是革命性AI研究智能体框架,用「两阶段推理 - 执行架构」和「持久化上下文记忆系统」,解决AI助手复杂研究任务的大痛点,模拟人类研究过程,适用于多场景。

CourseAI
算法论文8

训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式

大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过模块协作,实现推理“精准瘦身”,解决根本冲突。

深度学习自然语言处理
开源动态8

超越DeepSeek-R1,英伟达开源新王登顶!14万H100小时训练细节全曝光

英伟达Llama - Nemotron系列模型超越DeepSeek - R1且全部开源。论文揭秘其训练关键,如用合成数据监督微调与强化学习等。还介绍构建阶段、架构设计等,评估显示该系列模型在多任务表现出色。

新智元