后训练方法」共找到 4795 篇相关文章

算法论文8

揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路

上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。

量子位
算法论文8

正交化之外是什么?微软等提出ARO优化器:训练提速1/3,揭示矩阵优化新「蓝海」

微软研究院联合多校发布论文,提出新优化器 ARO。它将梯度旋转作为原则,能让大模型训练提速约 1/3,比 Muon 高效 10% - 15%,还能全模型优化,揭示了矩阵优化新方向。

机器之心
新闻资讯7

GitHub 2.5万星!日本开发者打造的Hono火了:定义React时代微框架的轻量未来

本周,Web 框架 Hono 在 X 官宣,GitHub 获 25000 星标。它由日本开发者 Yusuke Wada 于 2021 年创建,基于 Web 标准,可在多运行时运行,或指明 React 时代 Web 框架方向。

InfoQ
开源动态8

卡帕西630行代码炸出81个智能体,4天协作跑2333次实验,公布预训练十大发现

Karpathy的Autoresearch项目630行代码让AI自主实验,提升语言模型训练效率。全球开发者让多智能体协作,智能体自发形成同行评审制度。项目发起者公布十大发现,还衍生出表现出色的auto - discovery项目。

量子位
开源动态8

字节Seed新方法!开源8B代码模型:自己筛数据训练自己,同量级SoTA,还能超越百亿级对手

传统code大模型依赖人工筛选数据,成本高、效率低。而Seed - Coder团队让LLM自己筛选数据训练自己,打造8B参数轻量级开源代码模型,性能超百亿级对手,不过也存在通用和数学能力短板。

深度学习自然语言处理
新闻资讯7

用得越多、失业越快?GitHub 大改 Copilot 规则:默认拿个人代码训练 AI,还搬出 Anthropic 挡枪!

当地时间3月26日,GitHub宣布自4月24日起,Copilot Free、Pro和Pro+用户交互数据默认用于训练改进AI模型,但用户可手动退出。它称此举因模型需更多数据,还拿微软等挡枪,却遭开发者吐槽。

InfoQ
推荐文章7

智能流体力学专题研讨会特邀报告3|边鑫:混合深度学习与迭代方法的粘性不可压流动加速求解

2026年8月,第十四届全国流体力学学术会议在青岛举行,智能流体力学专题研讨会展示了人工智能与流体力学交叉领域进展。边鑫作《混合深度学习与迭代方法的粘性不可压流动加速求解》报告,介绍HyDEA求解框架。

力学与人工智能
新闻资讯7

抱上Meta“大腿”,自家公司要搞黄了?Scale AI狂丢大客户,又遭6年老员工“背刺”

9月3日外媒报道,Meta支持的Scale AI起诉前员工Eugene Ling及竞争对手Mercor,称其盗用商业秘密、违反合同。Mercor反驳,称对商业秘密无兴趣。Scale AI与Meta合作丢客户、裁员,声誉受损,而Mercor地位上升。

InfoQ
算法论文8

Shopee OnePiece:业内首个融合上下文工程、隐式推理和多目标训练策略的生成式搜推建模框架

2025年生成式推荐发展火热,但工业界落地多在序列化建模,替换传统范式遇阻。Shopee傅聪团队联合人大高瓴学院提出OnePiece范式,是业内首个融合多策略的生成式搜推建模框架,含上下文工程、隐式推理和多目标训练策略。

InfoQ
开源动态8

又是王冠:27M小模型超越o3-mini!拒绝马斯克的00果然不同

27M小模型HRM由拒绝马斯克的00王冠开发,超越o3 - mini - high和DeepSeek - R1,推理不靠思维链。它采用分层推理等五项核心技术,在多测试中表现出色,虽被指通用性不足,但有人看好其仿脑架构。

量子位