后训练策略」共找到 4329 篇相关文章

推荐文章8

投奔小扎,Jason Wei连发两篇博文公布“屠龙术”:一个公式看透AI,一条心法指引人生

OpenAI研究科学家Jason Wei被小扎挖走连发两篇文章。一篇提出“验证者定律”,指出训练AI解决任务难易与可验证性成正比;另一篇从强化学习悟到人生要走On - Policy路线,发挥自身优势。

AI寒武纪
算法论文8

一个模型统一4D世界生成与重建,港科大One4D框架来了

港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。

机器之心
开源动态8

性能提升84%-166%!L-Zero仅靠强化学习解锁大模型探索世界的能力 | 已开源

招商局狮子山人工智能实验室团队用RLVR让模型“自学”,构建L0系统,含NB - Agent框架和端到端强化学习训练流程,开源相关内容。测试显示L0显著提升模型性能,展现强大泛化能力。

量子位
算法论文8

dLLM的「Free Lunch」!浙大&蚂蚁利用中间结果显著提升扩散语言模型

近年来,扩散大语言模型(dLLM)成为文本生成新势力,生成效率高。但现有解码策略忽视中间迭代信息,研究团队观察到「先对错」现象,提出 TCV 和 TCR 方法,显著提升模型在推理任务表现。

机器之心
开源动态8

用2D先验自动生成3D标注,自动驾驶、具身智能有福了丨IDEA团队开源

IDEA团队张磊团队提出OVSeg3R开集3D实例分割学习新范式。它无需人工处理和3D掩码标注,降低训练成本,有望让3D实例分割商业落地,可用于自动驾驶、智能家居等领域。

量子位
新闻资讯7

谷歌营收被Nano Banana带飞!季度首破千亿美元,Gemini APP月活6.5亿

Nano Banana成爆款,Gemini月活达6.5亿。AI业务带动下,谷歌季度营收首破千亿美元。谷歌CEO称全栈式AI策略推动增长,谷歌还将加码AI基建投资,且与能源企业合作重启核电站。

量子位
开源动态8

社区供稿 | Index-AniSora 技术升级开源: 动漫视频生成强化学习

B站升级动画视频生成模型Index - AniSora技术并开源,支持多种二次元风格视频镜头一键生成。基于相关研究提出首个专为二次元视频生成的强化学习技术框架,构建奖励数据集、训练AnimeReward、提出GAPO优化策略,实验验证其有效性。

Hugging Face
产品应用7

Web 开发 AI 就选它?V0复合架构无错误率 93.87% 远超 Claude 4 Opus 单体!

Vercel推出新AI模型v0系列,采用复合模型架构,将RAG专业知识、SOTA大模型推理能力和定制流式处理模型结合,能提升代码生成质量,且基础模型升级时可快速替换,还训练了定制AutoFix模型。

AI进修生
开源动态8

抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o

抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,经全链路优化,在多数据集验证中表现卓越。

量子位
算法论文8

Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」

新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。

机器之心