行为校准强化学习」共找到 927 篇相关文章

产品应用8

抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10

传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。

InfoQ
算法论文8

AAAI 2025 Oral | 火山引擎多媒体实验室提出VQ-Insight,AIGC视频画质理解大模型

火山引擎多媒体实验室与北大合作论文《VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning》入选AAAI 2026口头汇报。VQ - Insight用渐进式框架处理AIGC视频画质理解,实验表现卓越。

机器之心
开源动态8

美团杀入视频生成模型赛道,LongCat-Video 136亿参数媲美顶尖模型,效率提升10倍

美团LongCat团队发布LongCat - Video基础视频生成模型,有136亿参数量,多任务表现出色。它核心亮点多,还建立了数据处理流水线,采用特殊架构和训练方法,提升了生成效率,性能媲美顶尖模型。

AIGC开放社区
算法论文8

经典之作!Agent无需奖励也能学习:通过“早期经验”的Agent Learning

该论文提出‘早期经验’范式,让智能体通过执行动作、观察结果状态学习,无需外部奖励。它能降低数据依赖,提升泛化与鲁棒性。实验显示,其在多样环境中效果出色,为智能体训练提供新思路。

深度学习自然语言处理
算法论文8

RLHF与RLVR全都要,陈丹琦团队最新力作将推理能力拓展到通用智能

普林斯顿大学陈丹琦团队发布学术成果,提出基于模型奖励思维的强化学习(RLMT)方法,弥合专门推理与通用对话能力差距,将链式思维优势扩展到更广泛范围,提升整体对话表现。

机器之心
算法论文8

提速30倍,Meta重新定义了新一代RAG!

LLM时代,RAG成知识密集型任务标准范式,但处理长上下文时面临延迟高、内存贵问题。Meta超级智能Lab针对RAG特殊结构优化,提出REFRAG框架,有独特训练策略,实验效果显著。

PaperAgent
算法论文8

VerlTool重塑Agentic RL的训练生态

当前LLM像‘缸中的大脑’,缺乏与外界互动能力。新范式ARLT兴起,但构建训练框架面临诸多挑战。VerlTool作为统一、模块化、高效的开源框架应运而生,解决难题,在多任务实验表现出色,推动LLM向智能体转变。

深度学习自然语言处理
新闻资讯7

The Batch: 872 | 机器藏羚羊混入羊群

中国科学院联合云深处科技等,将云深处科技的 X30 型四足机器人伪装成藏羚羊,引入可可西里保护区藏羚羊群,在不打扰它们的情况下进行观察。该机器人适应复杂地形和极端环境,还能跟踪羊群并传输数据。

DeeplearningAI
产品应用8

刚刚,智谱推出全球首个手机通用Agent,人人可用

智谱发布新版AutoGLM,是全球首个手机通用Agent。它为用户配备云端手机,能在不影响用户操作的前提下完成各类任务,还在技术上有重大突破,成本更低,代表全新互联网流量。

AGI Hunt
新闻资讯7

安全噩梦:Docker 警告 MCP 工具链中存在的风险

Docker 发文警告,基于 MCP 构建的 AI 开发工具存在安全漏洞,如凭证泄露、代码执行等。MCP 协议发展快但部分实现有隐患,Docker 分析发现诸多漏洞,还提出强化方法应对。

InfoQ