合成数据强化学习」共找到 3097 篇相关文章

7

Anthropic发布AI就业冲击报告,数据让人意外

Anthropic发布AI对劳动力市场影响的报告,基于真实数据和理论智能分析。提出“观察暴露度”新指标,揭示AI理论能力与实际应用差距大,还给出高危职业排行,分析受影响人群、安全职业等。

AI工程化
新闻资讯7

Databricks估值1000亿美元,AI数据分析平台

AI数据分析初创平台Databricks官网宣布进行K轮融资,估值超1000亿美元。距上次融资仅7个月,当时估值620亿。计划用新资本加速AI战略等。其与Snowflake竞争,抵制上市压力。

AIGC开放社区
推荐文章7

强化学习 AI 系统的设计实现及未来发展

本文是阿里巴巴算法专家曹宇在AICon 2025北京站的分享。从RLHF系统出发,结合实践展示RL系统现状与发展,探讨超大规模RL方向,涉及理论、业界实践、开源生态等,还介绍了AICon北京站活动。

InfoQ
8

ART:构建可靠智能体的强化学习新框架

现有AI智能体在真实场景表现不稳定,阻碍其应用走向生产。ART开源强化学习框架诞生,通过分离“前端”与“后端”、兼容OpenAI推理端点等创新化解困境,还给出使用方法,在案例中展现强大效能与经济性。

AI工程化
算法论文8

语言反思>强化学习:伯克利新架构碾压传统RL

大型语言模型下游任务优化依赖强化学习,但计算成本高。伯克利等机构论文提出GEPA新型优化器,将LLM执行轨迹转化为诊断信号,用语言反馈替代标量奖励,仅用传统方法1/35计算量,性能最高提升19%。

深度学习自然语言处理
算法论文8

ICML 2026 | Agentic强化学习训练的信息自锁问题

随着大语言模型走向真实交互,强化学习训练LLM agents时出现信息自锁问题。香港中文大学等研究者分析其原因并提出AREW方法,在多场景实验中表现稳定且具鲁棒性。

机器之心
开源动态8

智源开源EditScore:为图像编辑解锁在线强化学习的无限可能

北京智源研究院团队发布 EditScore 高保真奖励模型系列,为图像编辑强化学习提供精确奖励信号。团队提出两步解决方案,开发出 EditScore 系列模型,其在多方面表现优异,还验证了两大应用场景,有深刻研究洞见。

机器之心
推荐文章8

构建 AI 时代的知识底座:直播数据 LLM Wiki 实践

文章围绕直播数据 LLM Wiki 实践展开,指出领域知识沉淀面临挑战,引出 LLM Wiki。介绍其实际效果,如指标召回、代码生成等,阐述构建方法、架构设计、编译流水线、检索方式,还提及增量编译与持续 Lint,最后给出未来规划。

阿里云开发者
算法论文8

北航,清华,北大联合发布: 异构智能体协同强化学习!

北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。

机器之心
产品应用7

精准复刻!字节推出X-UniMotion实现高精度动作模仿合成

字节推出的X-UniMotion代表角色动画技术突破,提供统一运动控制系统,融合先进算法与操作界面,构建强大技术架构,能生成自然流畅角色动作,还介绍了其技术原理、演示对比等内容。

带你学AI