多阶段强化学习」共找到 2106 篇相关文章

推荐文章7

“谈故障色变”到有章可循:美图 SRE 故障应急与复盘实践

在 InfoQ 举办的 QCon 全球软件开发大会上,美图高级运维经理石鹏分享美图 SRE 团队故障应急与复盘实践,探讨故障应急各环节,剖析故障本质与原因,还交流 AIOps、LLM Ops 等技术。

InfoQ
算法论文8

Agentic Deep Research新范式,推理能力再突破,可信度增加,蚂蚁安全团队出品

尽管LLM能力提升,但在复杂任务上受静态内部知识限制。业界提出Agentic Deep Research系统,不过现存系统有梯度冲突和奖励稀疏问题。蚂蚁安全团队提出Atom - Searcher,解决上述问题,实验效果良好。

机器之心
算法论文8

用3D几何先验驱动视频扩散,实现更一致的世界生成

视频扩散模型生成新视角视频时,现有方法缺显式3D结构。智象未来提出DreamWorld,用3D先验与两阶段框架,结合结构和生成能力,在多基准测试表现领先。

机器之心
新闻资讯7

独家 | 前理想汽车联创沈亚楠成立「赫宇机器人」,布局家庭机器人

AI科技评论独家消息,前理想汽车联合创始人沈亚楠创立「北京赫宇机器人科技有限公司」,进军家庭机器人方向。赫宇机器人是其智能住宅品牌「栖息地」体系内新业务,项目处早期团队组建阶段

AI科技评论
产品应用8

三重激励+全周期扶持,即梦升级这个计划,让AI创作者的成长有迹可循

即梦AI创作者成长计划全面升级,构建覆盖三阶段的扶持体系,提供多维资源。该计划通过三重激励机制助创作者增收,还打造优质社区,持续开放至2025年12月。

机器之心
算法论文8

CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测

香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。

机器之心
产品应用7

Token消耗暴降80%,Cloudflare让服务器原生支持Markdown:OpenClaw要笑醒了

Cloudflare发布Markdown for Agents功能,让Web服务器可向AI Agent投喂Markdown数据,抛弃臃肿HTML,Token消耗降80%,还引入内容信号机制,有手动挡工具,功能处Beta阶段,可免费启用。

AI寒武纪
新闻资讯7

让记忆学会“进化”:探索 LLM Agent 的运行时价值感知与自适应检索 | 直播预约

本次直播将介绍最新研究成果 MemRL,提出作用于情景记忆的运行时强化学习方法,使 LLM Agent 能判断记忆价值,检索高价值经验,提升复杂未知环境下泛化性能与任务成功率。

深度学习自然语言处理
开源动态7

爆火开源AI画布,真正可落地的手写AI黑板

文章推荐开源AI画布PenEcho,它是个超智能黑板,适合学习场景,让手写与AI共生。能理解内容及空间关系,把回答放回画布,支持多模型,还具备多种功能。

开源AI项目落地
产品应用7

小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%

小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%。它能完成输入视觉回答问题、做几何体等任务,重点解决多模态推理、视觉理解及与人类偏好对齐问题,介绍了模型结构、训练阶段等内容。

CourseAI