「后训练课程」共找到 3813 篇相关文章
0.005%参数量超越SOTA!提升模型能力无需庞大奖励模型
上海交通大学等校联合团队提出轻量级奖励模型SWIFT,利用大模型隐藏状态线性特征,仅训练极小线性层,在推理任务中超越主流奖励模型,实现计算效率与准确率双提升,且在多领域表现出色。
从平面几何出发:形式化验证如何驱动MLLM的推理能力跃迁
多模态大语言模型在复杂数学与几何推理中有缺陷,现有训练方式让模型难有鲁棒推理能力。上海交大等团队提出“以形式化增强非形式化推理”方案,构建完整闭环,提升模型推理及泛化能力。
一周对战2500万局,这些「AI假人」让人类游戏玩家破防了
2025年巨人网络《超自然行动组》成黑马,新玩法中游戏怪物“假人”接入AI大模型。上线一周参与近2500万场对局,成国内首个深度融合AI大模型并规模化落地的大DAU游戏。
OpenAI偷袭,谷歌掀桌!2026开年第一场AI大战太精彩
OpenAI悄悄上线ChatGPT Translate挑战谷歌翻译,该工具支持超50种语言,有翻译后「二次加工」能力,但功能尚不完善。谷歌则高调开源TranslateGemma模型,支持55种语言,效率惊人,12B参数超越27B基线。
AI 味的原因找到了,都是 NTJ 惹的祸
作者因常被说说话像AI,好奇大模型MBTI类型。实验发现Claude - 4、Gemini - 2.5 - pro、GPT - 4为INTJ,DeepSeek是ENTJ。分析了大模型呈现NTJ特质的原因、AI味根源,还给出让大模型有情感的思路和使用技巧。
训具身模型遇到的很多问题,在数据采集时就已经注定了丨鹿明联席CTO丁琰分享
具身智能创企鹿明机器人联席CTO丁琰,分享具身智能数据采集现状、困境及新兴采集方式UMI。他强调具身模型问题多源于数据采集,还介绍鹿明产品FastUMI Pro,及其数据采集、模型训练生态。
让 AI 自己打怪升级,Meta用Self-play RL把Coding推向超级智能
Meta FAIR、Meta TBD Lab等朝着“超级智能软件工程Agent”迈出第一步。SSR让大模型零人类标注,靠自生成Bug和自修复稳定碾压人类数据基线,新旧范式对比优势明显,还介绍方法、实验结果与理论洞察。
Agentic-KGR:通过多智能体强化学习实现知识图谱的协同演化
文章指出静态知识库有覆盖缺失、时效滞后、建用分离问题。介绍 Agentic - KGR 创新点,如动态 schema 扩展等。实验显示其在图谱抽取和下游 QA 任务有提升,还呈现训练动态和图谱质量可视化结果。
Manus卖给了Meta!年初火爆年底数十亿美元被收购
Meta和Manus官网宣布,Meta收购Manus以提升通用Agent能力。此次收购费用数十亿,是Meta第三大收购案。Manus产品以“通用Agent”为核心叙事,今年先爆火、融资,后迁总部,最终被收购。
性能真的不重要了吗?Jeff Dean给出反常答案
Google传奇工程师Jeff Dean更新文档《Performance Hints》,指出性能不是最后调出来的,而是写代码初始就注定的。很多人因对‘慢’无感、忽视性能,导致代码低效,顶级工程师则有‘物理地图’,能避开高成本路径。