「后训练技术」共找到 5936 篇相关文章
Token烧不起了?比肩Claude Opus 4.6免费模型来了,还将开源
昆仑万维旗下天工AI发布SkyClaw - v1.0,为Agent场景深度优化,免费试用后将开源,价格低。性能超同级别开源对手,逼近闭源巨头。训练围绕环境构建、数据合成、强化学习展开,适合长链路Agent工作流。
西门子RXD大会揭秘:AI闯进工厂,胜负手不在算法|甲子光年
西门子于2026年3月23 - 24日召开RXD大会,探讨AI进入生产流程后的挑战与路径。大会指出工业AI落地需软硬协同,西门子依托制造积淀打通全栈技术,还强调开放协作及生态建设的重要性。
起底智元机器人,谁在推动一个庞然大物向前
文章揭秘智元机器人掌舵人,介绍其发展历程。智元成立三年发展迅猛,早期靠舒远春找钱、彭志辉出名,邓泰华攒局。后有姚卯青等助力产品落地量产,技术路线转变引人员流动,还进行内部改革、转变销售模式。
陈丹琦新作:大模型强化学习的第三条路,8B小模型超越GPT-4o
陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。
开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具
Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。
10 年后,Kimi 团队重新发明残差连接。马斯克和 Karpathy 同时点赞
Kimi团队发布技术报告,提出用Attention Residuals替换残差连接。实验显示其在各尺度模型上表现优于基线,降低训练成本。马斯克和Karpathy点赞,这或标志深度学习基础范式进入重新讨论阶段。
13人干翻Transformer!新架构SSA算力暴减千倍,成本仅Opus 5%
一款基于SSA架构的AI模型SubQ横空出世,其上下文高达1200万Token,计算量比Transformer暴减1000倍,成本不到Claude Opus的5%。打造它的Subquadratic公司仅13人,产品发布后引发AI社区不同反应。
Meta正炼化老板:24小时不间断工作,扎克伯格真成机器人了
《金融时报》爆料,扎克伯格正将自己炼成“代理CEO”扎克bot,由其影像和语音数据训练,本人也参与其中。超级智能实验室攻克相关技术难题,Meta还开发“CEO Agent”,但项目上线或面临问题。
agent未来落地的收敛形态
当前agent开发变重,基模优化与agent开发脱钩。后续落地的技术收敛范式是将基模训练和agent开发有机结合,有模型更小、agent更智能、基模深入业务场景带来新想象力等好处。
超实用提示词模板!AI科学家教你用协作提示词激发大模型潜力
文章由知名AI科学家Lance Eliot所写,指出主流大语言模型因训练机制变得‘短视’,缺乏深度协作能力。介绍协作提示词技术,能让AI成为主动引导者,并以测试展示效果,还说明了适用场景。