上下文强化学习」共找到 2077 篇相关文章

算法论文7

Meta最新大模型RL微调:在线DPO/GRPO显著优于离线DPO

Meta和NYU研究强化学习在大模型微调中的有效性,对比离线、半在线和在线训练范式。半在线和在线显著优于离线,多任务结合可验证与不可验证任务能提升性能,还给出不同任务的测试数据。

PaperAgent
算法论文8

ICML 2025 Spotlight | 新理论框架解锁流匹配模型的引导生成

西湖大学冯睿骐、吴泰霖等针对流匹配模型能量引导算法难题,推导新理论框架,提出三大类实用算法,给出性能分析与比较,为流匹配引导采样及生成模型应用提供理论基础。

机器之心
开源动态8

从AI Agent到Agentic AI:开源如何助力开发者解决行业痛点?

2025年全球开源软件项目数量增长,中国企业贡献显著。字节跳动在火山引擎原动力大会开源开发者日上,多位负责人分享开源经验,探讨其为AI Agent带来的技术改变,展示解决行业痛点的理念与实战经验。

InfoQ
算法论文7

The Batch: 979 | LLM 清理智能体的“垃圾”

研究人员提出选择性管理智能体记忆之法,小红书Xubin Hao等构建Self - GC。它在送上下文给LLM前,让大语言模型决定内容取舍。测试显示其删历史少且保留必要细节能力强,不过未测其输出质量。

DeeplearningAI
开源动态8

Meta发布Omnilingual ASR:支持1600+语言的开源语音识别系统

Meta发布全新自动语音识别系统Omnilingual ASR,支持超1600种语言,核心创新是零样本和少样本学习能力,降低小语种语音识别门槛。项目提供不同规模模型,安装调用简单,目前仅支持40秒内音频,数据集和项目均开源。

AI工程化
产品应用7

AI改造激光焊接检测!“过杀”率暴降50%,国际头部客户产线已用上

在第三届国际供应链博览会上,广州德擎光学科技的激光焊接在线检测系统展示了AI+先进制造检测落地效果。基于深度学习的AI检测模型,使焊接检测“过杀”率降50%,产线检测精度和效率提升,已用于国际头部客户产线。

量子位
推荐文章7

对谈 Memories AI 创始人 Shawn: 给 AI 做一套“视觉海马体”|Best Minds

本文是对 Memories AI 创始人 Shawn 的访谈。他指出当下 AI 记忆多为“上下文工程”,其团队致力于打造视觉记忆层 LVMM。还探讨了视觉与文本记忆区别、LVMM 架构及应用场景等,认为视觉记忆将成下一代 AI 核心。

海外独角兽
产品应用7

高通Nuvia架构介绍

本文详细介绍高通Nuvia架构。Nuvia由经验丰富芯片设计师创立,后被高通收购,旨在强化自研技术、拓展市场。Oryon CPU架构是其成果,虽面临法律争议,但设计独特,多方面表现出色,还具备安全功能和较高性能。

芯师爷
新闻资讯7

狂砸百亿美元后,仅5%企业成功落地AI,他们做对了什么?

企业在生成式AI领域投入数百亿美元,但95%的机构未获可衡量商业回报,此为「GenAI鸿沟」。原因包括工具缺乏学习能力、预算分配失衡等。少数成功企业聚焦高价值用例,选易部署工具,与供应商深度合作。

Founder Park
新闻资讯8

两个月连获两轮数亿元融资,深度机智以全栈自主路线加速国产物理AI基座模型落地|甲子光年

物理AI是全球科技竞争焦点,深度机智率先定义‘人类学习’技术路线,成立一年全链路落地。近日完成数亿元融资,下轮融资收尾。其数据、模型、硬件成果显著,产品全落地,订单数千万元,团队强大,将推动国产物理AI普及。

甲子光年