「后训练策略」共找到 4329 篇相关文章
拿到DeepMind、Meta等多家Offer后,她把机器学习求职面试的真相写了出来
牛津大学博士生Silvia Sapora把机器学习求职面试经历原原本本写在博客中。她分享面试准备技巧、心态与谈判策略,提醒一次面试表现不定义研究者价值,该文对求职者或许比题库更有用。
冷门新语言AI写不动?IEEE论文:从零到及格线,MoonBit给出完整训练路线
IEEE论文聚焦新语言MoonBit和Gleam,探讨大模型代码生成能力。研究发现大模型零样本生成新语言代码能力差,few - shot和RAG有提升但有限,继续预训练及指令迁移可显著提高模型表现。
杨植麟回复:Kimi K2训练用的H800!但“只花了460万美元”嘛…
月之暗面团队回应Kimi K2 Thinking训练成本,透露用英伟达H800,GPU少但利用充分。该模型凭实力与低成本引迁移潮,还引发对闭源巨头估值反思。技术上有优化创新,团队还公开答疑。
首个开源实现100%可复现的稳定RL训练框架来了!2次结果完全重合
SGLang团队联合slime团队开源实现100%可复现的稳定RL训练框架。基于Qwen3 - 8B重复实验结果完美重合。SGLang在批次不变算子基础上实现确定性推理,性能有下降但有提升空间,还给出使用方法和未来规划。
Claude Code 火爆被玩坏后,刚刚Anthropic 索性掀桌子:推出非编程版 Claude Cowork
继Claude Code被用户广泛应用于多领域后,Claude推出非编程版Cowork,向macOS应用Claude Max订阅用户开放。它能处理非编码工作,自主性强,但也存在潜在风险,当前为研究预览版。
3.8K Star!港大开源 AI 量化神器:一句话生成量化策略,普通人也能玩懂!
港大开源的Vibe - Trading在投资圈火了,它是AI驱动的多智能体金融工作台,能将自然语言请求转化为交易策略等。有多智能体协作架构,内置64个金融技能、29个智能体团队预设,提供4种安装使用方式。
微软开源Skill训练框架,让Agent白天干活,晚上自动复盘,Skill的自进化终于可监控了
微软开源SkillOpt v0.2.0,加入SkillOpt - Sleep让Agent可自我复盘。该文本空间优化框架能自动训练和优化skill,有透明化、质量控制等特点,适合重复、可评估任务场景。
从 0 到 1 做一款 AI 产品:技术怎么搭、成本如何控制、销售策略怎么定?
独立开发者 Arvid Kahl 分享从零构建 AI 播客产品 Podscan 及「节俭工程」经验,涵盖技术搭建、成本控制与销售策略调整。如用小众云服务降成本,从 PLG 转向 SLG 等,为小团队创业者提供实用借鉴。
比传统方法强7倍:Anthropic物理隔离危险知识,重塑大模型安全训练范式
Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统方法7倍,还能处理未标记危险数据。
Figure抛弃10万行C++代码!用1000小时人类数据训练神经网络,实现全身控制基础模型
美国机器人公司Figure推出具身大脑Helix 02及家务demo。其搭载的Figure 03在厨房自主完成复杂任务,且实现端到端全身控制。新引入的System 0基于人类数据训练,替代大量手写代码,还展示多种灵巧操作。