训练策略」共找到 2780 篇相关文章

算法论文7

Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制

论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。

深度学习自然语言处理
开源动态8

The Batch: 869 | 编码助手的训练数据

研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。

DeeplearningAI
新闻资讯8

突发!OpenAI紧急暂停GPT-6训练

OpenAI奥特曼官宣暂停下一代旗舰模型强化学习训练两周,原因是确保安全等标准跟上能力水平。触发因素有Hugging Face事故和Astra达安全红线,后续将让AI监管AI,加固三道安全防线。

新智元
算法论文8

无需训练的LLM对齐方法综述

大型语言模型应用引发担忧,传统微调方法有短板,免训练对齐(TF Alignment)应运而生。本文是首篇系统综述TF对齐技术的论文,提出三阶段分类框架,实验显示TF方法优势明显,还指明未来研究方向。

深度学习自然语言处理
产品应用8

阿里WebDancer:训练类DeepReaserch的Agentic Model

来自阿里巴巴通义实验室的研究员推出WebDancer,这是一个原生信息检索的Agentic Model,能自主浏览网页、思考和决策。它基于ReAct框架,经多阶段训练,在信息检索基准测试中表现出色,为解决复杂检索问题提供新思路。

PaperAgent
算法论文8

OpenVision 2:大道至简的生成式预训练视觉编码器

多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。

机器之心
产品应用8

智谱AI发布桌面Agent,轻松训练 AI数字员工

智谱AI发布ComputerRL自主桌面智能框架,旨在让AI像人一样用电脑。它融合API与GUI,采用分布式训练,引入Entropulse解决探索衰减。在OSWorld测试中表现亮眼,虽有视觉感知等挑战,但意义重大。

AIGC开放社区
产品应用7

一群年轻人,正在训练AI宠物的灵魂 | 甲子光年

文章讲述了芯宠工场团队训练AI伴宠Lito的过程。通过各种试验,Lito能做出预设外反应,其‘灵魂’在与人类互动中生长。团队面临功能与情感的抉择,市场上也有其他创业者挖掘AI情感陪伴赛道。

甲子光年
开源动态8

微软 SkillOpt:不动模型权重,只训练那份「技能说明书」

微软研究院 Yifan Yang 等人推出 SkillOpt,思路反直觉,不动模型权重,把「技能文档」当可训练参数。它在 52 个组合中表现最优,技能可迁移,代码已开源,还支持多操作。

AI工程化
推荐文章8

Manus:3大核心策略,破解AI Agent上下文膨胀难题

当AI Agent调用工具结果大量涌入上下文窗口,LLM性能会下滑。Manus联合创始人拆解其上下文工程逻辑,给出‘减少、卸载、隔离’三大策略及模型选择等方法,还提炼出6条实践启示。

CourseAI