三阶段训练」共找到 3254 篇相关文章

新闻资讯7

AI自我训练?OpenAI研究员Jason Wei泼冷水:它的大瓶颈你根本想不到

OpenAI研究员Jason Wei认为AI自我完善是未来趋势,但不会‘瞬间爆发’,而是漫长过程。他从方面阐述,包括自我完善非一蹴而就、不同领域完善难度有差异、科学进步受真实世界实验限制。

AI寒武纪
算法论文7

李飞飞团队新作:DiT不训练直接改架构,模型深度减半,质量还提高了

本文介绍「嫁接」技术,可在小计算预算下编辑预训练 DiTs 探索新架构。不从头训练,替换算子创建混合架构,保持质量同时减少计算量。还通过实验展示该技术在构建高效架构和文生图模型中的效果。

机器之心
推荐文章8

YOLOv8 模型训练入门指南:手把手搞定目标检测AI

本文是从零训练 YOLOv8 模型的完整实录,介绍了 YOLOv8 特点,以“识别猫”为例,详述训练步骤,指出训练难点,还推荐学习资源与工具,鼓励前端程序员尝试做 AI 模型训练

AI Reading Hub
算法论文7

大模型的第一性原理:()信息论篇

本文从信息论角度解读大模型第一性原理。介绍Shannon信息论,提出将其从以BIT为中心转换为以TOKEN为中心解释大模型底层原理,还阐述大模型各阶段信息论原理、定向信息计算方法,对比Granger与Pearl因果。

机器之心
8

Anthropic发布「AI原生创业公司」手册:涵盖全流程四大核心阶段,一人公司法典来了

Anthropic发布打造AI原生创业公司手册,针对2026年可能性梳理创业四阶段:想法、MVP、上线和规模化,明确各阶段目标、退出标准、失败模式及AI实操练习,涵盖研究、编码、运营等方面。

AI寒武纪
算法论文8

Diffusion约2倍无损加速!训练-推理协同的缓存学习框架来了| HKUST&北航&商汤

HKUST、北航与商汤提出HarmoniCa框架,解决Diffusion模型推理慢、成本高问题。它通过SDT和IEPO机制,解决训练 - 推理脱节,在多模型上实现推理提速、质量提升,且训练推理开销低,已开源。

量子位
算法论文8

新范式来了!新能量模型打破Transformer++扩展上限,训练扩展率快35%

研究训练新能量模型 EBT,为输入和预测分配能量值,模拟思考过程。它有跨模态、跨任务通用性,训练扩展率比 Transformer++ 高 35%,推理性能提升 29%,还在多任务中表现出色,是扩展模型能力新范式。

机器之心
推荐文章7

AI 基础知识从 0.6 到 0.7—— 彻底拆解深度神经网络训练的五大核心步骤

文章以 PyTorch 手写数字识别代码为引,深入剖析深度神经网络训练的五大核心步骤,涵盖前向传播、计算损失、反向传播、更新参数和循环训练,还介绍激活函数、Dropout 等概念及正则化、优化器等技术。

阿里云开发者
新闻资讯7

OpenAI新模型,被曝秘密训练中!万字硬核长文直指o4核心秘密

SemiAnalysis爆料,OpenAI正训练规模介于GPT - 4.1和GPT - 4.5间的新模型,下一代推理模型o4基于GPT - 4.1训练。强化学习成推理模型进步功臣,但面临基础设施瓶颈,奖励函数难定等问题。

新智元
算法论文8

Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍

大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。

机器之心