「后训练框架」共找到 4932 篇相关文章
啊?微博7800美元训的大模型,数学能力超了DeepSeek-R1
近日,微博发布自研开源大模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后训练成本仅7800美元。其为AI产业带来新思考,还将推动微博AI应用发展。
无VAE扩散模型! 清华&可灵团队「撞车」谢赛宁团队「RAE」
清华大学智能视觉团队和快手可灵团队联合推出《Latent Diffusion Model without Variational Autoencoder》,提出 SVG 框架,用预训练视觉特征编码器替代传统 VAE,解决了传统「VAE + Diffusion」范式的效率与通用性痛点。
挑战ReAct!MetaGPT团队提出ReCode智能体新范式
DeepWisdom研究员指出当前主流智能体框架受固定决策粒度束缚,提出ReCode新范式。它统一规划与执行,能在不同粒度间自由切换,实验显示其性能、成本和训练效率均有提升,引发广泛关注。
小米陈龙团队首作:统一具身与自动驾驶的开源模型
小米具身智能团队发布首篇论文,提出统一具身智能与自动驾驶的新模型MiMo-Embodied。该模型在多任务中领先,其四阶段训练框架打通两领域边界,为行业提供新范式。
EMNLP 2025 | CARE:无需外部工具,让大模型原生检索增强推理实现上下文高保真
MetaGPT等机构团队发布CARE框架,可让LLM将推理上下文与自身检索能力结合,已全面开源。它提出原生检索增强推理范式,采用两阶段训练策略,在问答基准实验中表现出色,为解决模型问题提供新路径。
OpenAI不Open!7年功勋老将投奔宿敌,实验室沦为API代工厂
2026开年,OpenAI的「推理之父」Jerry Tworek离职,他入职近七年,是推理技术核心人物。Scaling Laws失效,后训练成主要出路,但深度推理成本高,在强调盈利环境下,Tworek不满研究受限而离开,OpenAI或失去通往AGI的机会。
社区供稿 | Index-AniSora 技术升级开源: 动漫视频生成强化学习
B站升级动画视频生成模型Index - AniSora技术并开源,支持多种二次元风格视频镜头一键生成。基于相关研究提出首个专为二次元视频生成的强化学习技术框架,构建奖励数据集、训练AnimeReward、提出GAPO优化策略,实验验证其有效性。
让机器人「不仅会想,还能准确去做」,VLA-R1把「推理+行动」带进真实世界
VLA-R1是“先推理、后执行”的VLA基础模型,结合链式思维监督与强化学习,优化推理和执行。它有两阶段训练、三类可验证奖励等创新点,经多层面测试效果好,在多领域有应用前景。
GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026
本文聚焦基于模型的离线强化学习,指出RAMBO算法存在保守性难控和训练不稳问题。为此提出ROMI方法,引入鲁棒价值感知框架与隐式可微自适应加权机制,在多基准任务上超越基线算法。
为什么 AI 喜欢用破折号
文章探讨AI爱用破折号的原因。AI常用“delve”源于非洲导师打分偏好,但破折号并非如此。作者发现这一现象在GPT - 4后凸显,原因或为AI公司用旧书训练,使AI继承旧时代写作风格。