RL训练范式」共找到 2917 篇相关文章

算法论文8

社交Agent: 通过RL学习自适应Thinking,根据场景在“秒回”和“深思”间灵活切换

现有聊天机器人在人情世故场景表现不佳,论文指出大模型思维‘一根筋’。研究团队设计4种思维模式,用AMPO强化学习算法动态切换。在模拟社交任务中,AMPO表现超GPT - 4,省时高效。

深度学习自然语言处理
新闻资讯8

深度机智和他们的另一条路:用人类第一视角数据训练基座模型|甲子光年

3月27日,深度机智联合推出具身通用智能基座模型系统PhysBrain 1.0,引入人类第一视角数据,解决传统模型问题。其创始人陈凯等坚持用此数据构建模型,突破传统,引领行业新方向,且中国在具身智能领域或借此建立自主技术体系。

甲子光年
开源动态8

KTransformers入选计算机系统顶会、与主流框架合作,趋境&清华让「异构」成为推理新范式

KTransformers由趋境科技与清华团队联合研发,是高性能异构推理框架。其论文入选SOSP 2025,还与SGLang合作。它有算子优化等创新,能让CPU与GPU协同,推动推理架构融合,已成广泛复用的底层框架。

量子位
算法论文8

LLM越狱攻击的威胁被系统性高估? 基于分解式评分的「越狱评估新范式」出炉

目前LLM越狱攻击评估常依赖间接指标或LLM宏观判断,易有偏差。德国、中国等研究团队提出JADES框架,用分解式评分机制,揭示过去高估越狱攻击威胁,为评估建新标准。

机器之心
算法论文8

EMNLP25 | "大模型在环"技术新突破:Dial-In LLM 推动中文客服意图聚类新范式

本文提出LLM-in-the-loop意图聚类框架,以传统聚类为骨架,微调后的中文LLM做语义裁判和命名批注。在10万+真实客服通话数据集上超越基线,解决现有方法依赖词向量、缺乏可解释性、调用大模型成本高的问题。

深度学习自然语言处理
算法论文8

字节Seed提出M3-Agent:像我们一样"记住"与"思考"的长视频理解新范式

字节Seed提出M3 - Agent,这是首个融合实时视听输入、类人记忆构建与自主推理的多模态智能体。它模仿人类记忆机制,解决长视频理解痛点,已被CVPR 2025收录并开源代码,为通用人工智能奠定基础。

深度学习自然语言处理
算法论文8

推荐大模型来了?OneRec论文解读:端到端训练如何同时吃掉效果与成本

随着AI发展,推荐系统面临诸多问题,快手技术团队提出OneRec,以端到端生成式架构重构推荐系统全链路,在效果与成本上实现突破,已在快手双端服务用户,也有需完善之处。

机器之心
算法论文7

一招缓解LLM偏科!调整训练集组成,“秘方”在此 | 上交大&上海AI Lab等

上海交大和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当会加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。

量子位
新闻资讯7

a16z聊AI编程:别担心被取代,新玩家、新范式带来的是「很多」机会

a16z三位投资合伙人认为AI Coding是第二大AI市场,有望成最大单一市场。他们对编程未来不悲观,指出新人群与新方法或催生新软件形态,编程语言不会被取代,资深工程师仍被需要。

Founder Park
算法论文8

泛化性暴涨47%!首个意图检测奖励范式,AI工具爆炸时代意图识别新解法

随着大模型和工具增长,AI 助手意图识别遇新挑战。腾讯 PCG 团队用强化学习等方法,提升模型泛化能力,还从多方面剖析优势,最后提出未来研究方向。

机器之心