「后训练策略」共找到 4342 篇相关文章
微软 & UT Dallas 联手揭秘:从 SFT 到 RL 的进阶之路
微软与 UT Dallas 合作论文揭秘大模型做漏洞检测从 SFT 到 RL 的后训练流程,构建 C/C++ 漏洞数据集跑通全流程,总结六大‘避坑’指南,还开源整套框架、数据集和模型。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5长文本推理专家,提供端到端长文本推理后训练“配方”,含数据合成管线、强化学习方法、智能体架构,在多基准测试成绩佳,代码已开源。
阿里新研究:统一了VLA和世界模型
阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。
一篇92页大模型Vibe Coding技术全面综述
中科院计算所&杜克大学发布首篇Vide Coding技术全面综述。介绍以“氛围/结果”为导向的Vibe Coding开发范式,含技术分类、能力分析、开发模式、数据模型等内容,还提及价值及反馈回路等。
让YOLO飞起来:从CPU到GPU的配置指南
文章指出默认安装的YOLO用CPU计算,处理大量图像或实时检测任务效率低。详细介绍将YOLO从CPU模式切换到GPU模式的步骤,对比性能,还给出常见问题解决办法,能显著提升运行效率。
大模型“拼好题”,45K数据撬动18%提升,数学问题拒绝死记硬背 | MathFusion
上海AI Lab等团队提出MathFusion,通过三种“融合策略”生成新的融合数据集MathFusionQA,仅用45K合成指令,在多基准测试中平均准确率提升18.0个百分点,增强模型解决数学问题的能力。
年度AI论文!全球三大顶尖模型的防蒸馏机制全面告破:小模型“套出”大模型隐藏思维链,Kimi-K3重现概率异常
这篇论文指出三大前沿AI模型厂商API有密码学旁路漏洞,攻击者用轻量级模型就能恢复大模型隐藏思维链数据。还揭示部分模型训练或借鉴大模型思维链,此漏洞也致企业数据隐私安全问题。
一条被开发者踩出来的路:OpenClaw“涌进”飞书
在中文社区,越来越多开发者将 OpenClaw 接入飞书,飞书接口生态开放且更新快。这波热度并非官方推动,开发者先实践,后飞书将路径官方化,补齐链路,其优势在于便捷实用,正朝“入口级”智能平台转变。
回村拜年、赶集舞狮:一台小机器人的县城奇幻漂流|甲子光年
2026马年春节,人形机器人迎来高光。‘清华系’加速进化公司将小型人形机器人Booster K1带回乡村,在多样场景测试。该公司走小而美路径,产品性能优、销量好,通过B端、C端策略打开市场。
Dia 没死,人家转手就发了 1.x 版本
OpenAI 发布浏览器 Atlas 引发讨论,有人认为其有缺陷会失败,也有人觉得初创 AI 浏览器会被巨头收割。以 Dia 为例,它被收购后加快迭代,推出 Skills Gallery、Research 等功能,还新增连接 App 等特性。