「后训练策略」共找到 4329 篇相关文章
训练世界模型,开始从人类的肌肉和脑子里偷师了
具身智能数据竞争进入新阶段,第一视角视频虽缓解数据量问题,但未记录人行动的原因及大脑身体实时修正。FaceMind提出Ego - NeuroLoop数据范式,配套NeuroMatrix和NeuroBooster,将训练数据从“行为库”推向“闭环库”。
如何为 GPU 提供充足存储:AI 训练中的存储性能与扩展性
文章分析 MLPerf Storage v2.0 测试结果,探讨不同存储系统在 AI 训练中表现。在满足 GPU 利用率阈值下,能支撑更多 GPU 的存储系统扩展性与稳定性更强,还需关注资源利用率。以太网存储方案灵活且成本效益高。
英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速
多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。
蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据
蚂蚁集团论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获VLDB工业赛道最佳论文。其研发的OmniTable系统能管理超35PB、3050亿条以上训练数据,解决数据准备难题,如在SFT任务中大幅缩短周期。
最新 AGI 暴论:强化学习的「GPT-3 时刻」实现,还需要 1 万年?
国外AI初创公司Mechanize三位创始人联合撰文称,RL或迎“GPT - 3时刻”,但需数千至上万年“模型处理任务所用时间”训练。还提出“复制训练”新范式,能磨炼模型能力,补足短板。
奥特曼震撼预言:6个月后,ChatGPT将彻底接管你的人生
OpenAI首席执行官奥特曼预言,未来6个月,下一代AI将彻底看懂用户,实现人机共生。当前OpenAI的Chronicle和Dreaming V3分别在屏幕上下文与对话合成方面有进展,且几乎整个AI行业都在押注记忆方向。
突发!卡帕西宣布入职Anthropic
大神Karpathy宣布加入Anthropic,重回一线大厂。他曾多次在AI领域转换角色,此次将加入预训练团队,开展用Claude加速自身预训练研究。外界揣测其离开OpenAI原因,加入Anthropic能为研究提供更多资源。
机器狗腿被锯了也能继续走!最新机器人大脑来自320亿估值独角兽
Skild AI推出Skild Brain机器人大脑,它在虚拟环境训练相当于一千年时间成型。此模型没在对应机器人训练,控制能力是涌现的,能应对肢体断裂、马达卡住等情况,还可完成精细动作。
Karpathy:别再问AI「你怎么看了」,这是错误的提示词策略!
Andrej Karpathy提出不要把大语言模型看作实体,应视作模拟器。他建议探索话题时避免用‘你怎么看’提问,给出‘什么样的一群人适合探索,他们会怎么说’的更优策略,还指出不同领域影响有别。
ICLR 2026 | OpenAI打广告后,如何成为爆款?CMU提出AutoGEO解密流量密码
AI搜索引擎渐成主流,OpenAI引入商业推荐后,内容在AI搜索成爆款取决于AI引用偏好。CMU团队在ICLR 2026论文中提出AutoGEO,抽取引擎偏好规则改写网页,实验证明其有效且兼顾引擎效用。