「合成数据强化学习」共找到 3097 篇相关文章
改变强化学习范式,Meta新作呼应Sutton「经验时代」预言
图灵奖得主等提出AI智能体将迎「经验时代」,但训练面临挑战。Meta研究用「早期经验」范式解决问题,包含隐式世界建模和自我反思,提升了智能体任务成功率和泛化能力。
模型、代码、数据全开源!轻松训练自己的垂类Agent!
Together AI联合Agentica推出`DeepSWE-Preview`,基于开源Qwen模型,用RL在SWE - Bench - Verified登顶。团队将模型权重、训练框架等全开源,抛弃SFT纯用RL训练,还分享训练秘籍和TTS技巧,为垂类Agent训练提供新范本。
苹果出手!改进GRPO,让dLLM也能高效强化学习
苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。
北大开源统一世界模型框架:多类合成推理任务一套搞定
世界模型研究中,不同任务存在接口不统一等问题。北大DCAI课题组联合多方推出OpenWorldLib推理框架,整合多模态能力,构建标准化接口体系,在多任务上评估效果良好,降低研发门槛。
TanStack Start 推出导入保护机制,强化服务器与客户端边界划分
TanStack Start引入基于Vite的导入保护功能,防止服务器与客户端代码相互泄露,默认在新项目启用。该功能以插件形式运行,开发和生产环境行为不同,还能添加自定义规则,用户反响积极。
科技CEO用ChatGPT+基因数据定制癌症疫苗!肿瘤缩小50%
科技从业者Paul的爱犬Rosie患罕见癌症,传统治疗难见效。他借助ChatGPT、AlphaFold等,结合基因测序数据,联合科研机构为狗狗定制mRNA癌症疫苗,使肿瘤缩小50%,但自主研制引生物安全担忧。
强化学习新发现:无需数学样本,仅游戏训练AI推理大增
莱斯大学、约翰斯・霍普金斯大学和英伟达研究团队有颠覆性发现,让多模态大语言模型玩简单游戏,无需数学样本,就能显著提升其多模态推理能力。提出的ViGaL方法在多个基准测试中表现出色。
Claude深夜更新!DeepResearch+MCP入侵你的私人数据,威力很大!
Anthropic宣布Claude的「Integrations」集成功能和「Advanced Research」高级研究能力两项更新,改变人与AI交互方式。集成功能可连接多种应用,高级研究能力增强了搜索研究能力,这些更新标志着AI助手向工作伙伴转变。
阿里财报+96%是假象:扒开数据,真利润只剩8600万
5月13日盘前阿里发布2026财年Q4财报,主流标题称净利润同比增96%,股价盘前一度涨7%。但经分析,扣掉投资浮盈后真利润仅8600万。文章还给出财报分析方法、释放的关键信号及投资建议。
为什么AI总是"记错"你?我们造了一个"合成人生"来测试
现有AI记忆评测只记'事'不记'人',存在数据源窄、不重理解、注入成本高的问题。QuantaAlpha联合高校团队提出CloneMem基准测试,用'数字痕迹'评估AI Clone长期记忆能力,实验有反直觉结论并给出设计启示。