后融合」共找到 2367 篇相关文章

算法论文8

用中等难度prompt做高效post training

近年来,RL训练在LLM发展中至关重要,但传统方法效率低。本文提出PCL轻量级算法,通过动态选中等难度提示提升LLM训练效率,经多基准实验验证其优越性,也指出方法局限与未来方向。

深度学习自然语言处理
产品应用7

在 Mac 上安装最新版 OpenClaw 并接入企业微信之,一切都改变了

文章介绍在Mac上安装最新版OpenClaw及接入企业微信的方法。新版本功能增强,安装可连接多种工具。接入企业微信,能实现诸多功能,如分析股价、制定健身计划等,还能拓展写作等技能。

MacTalk
开源动态7

一夜之间,Claude Code删掉了80%系统提示词

本周五,Anthropic 技术团队成员 Thariq Shihipar 介绍新一代大语言模型工程趋势变化。Anthropic 发现旧提示词工程范式在新一代强推理模型发布或过时,新的 Claude.md 应精简,大砍系统提示词可把特定任务上下文交给 Skill。

机器之心
算法论文8

告别多奖励跷跷板:Flow-OPD将多教师OPD带入图像生成

中国科学技术大学等机构团队提出Flow - OPD,这是首个将OPD引入流匹配模型的统一多任务训练框架。它解决了流匹配模型训练对齐中多任务的梯度冲突等问题,效果良好,未来有多个拓展方向。

机器之心
算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕大语言模型训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
推荐文章7

播客手记 01 | 极睿武彬:创业就是,我愿意过刀尖舔血的生活

本文讲述极睿科技武彬的创业历程。早期获融资业务方向错误致公司濒临绝境,转型对接传统商家获黄峥融资。疫情时他转型销售挽救公司,还成“网红”提升获客效率,他认为创业要回归商业本质。

AI科技评论
开源动态8

LangChain 彻底重写:从开源副业到独角兽,一次“核心迁移”干到 12.5 亿估值

本周,LangChain 宣布完成 1.25 亿美元融资,投估值 12.5 亿美元,还发布里程碑式更新,LangChain 1.0 正式登场,这是一次从零开始的重写。它最初是副业,成热门开源项目,此次重写解决了过往问题。

InfoQ
新闻资讯7

字节、快手、小红书之,阿班押注下一代种草要从“围观”走向“体验”

Dreamova 创始人阿班在经历字节、快手、小红书工作创业,定位 AI 时代「体验式生活方式平台」。他认为 00 不满足围观式种草,要自己体验。产品让用户将喜欢的生活方式一键变成体验视频,可代入调整。

Founder Park
算法论文8

Claude团队用Qwen测试全新训练方法

Anthropic最新研究提出中训练(MSM),在预训练训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。

量子位
开源动态8

Issue修复开源No.1!蚂蚁 | 提出代码图模型:CGM,结合GraphRAG架构,领先最强开源7.33%

为解决开源模型在仓库级代码理解上的能力瓶颈,蚂蚁全模态代码算法团队提出 CGM 架构,融合仓库结构与语义信息。CGM 首创图结构与语言模型融合的对齐框架,还搭配了 GraphRAG 框架,在多个代码任务中表现出色,且相关资源均已开源。

AINLPer