「带可验证奖励的强化学习」共找到 1547 篇相关文章
作为一个接过Aha单的YouTube博主,我来聊聊这个AI产品
文章指出当下AI Agent分化为通用型、生活服务型、开发者工具型和垂直行业型四类。以Aha为例,介绍其作为达人营销垂直Agent平台,在筛选达人、匹配合作、保障安全等方面的优势,还分析了适用与不适用的产品情况。
重磅开源!首个全异步强化学习训练系统来了,SOTA推理大模型RL训练提速2.77倍
清华大学和蚂蚁技术研究院联合团队开源全异步强化学习训练系统 AReaL-boba²,坚持“全面开源、极速训练、深度可定制”理念,实现异步 RL 训练,训练速度最高提升 2.77 倍,支持多轮智能体强化学习训练。
真机RL杀疯了!机器人自学20分钟100分,数字孪生封神
至简动力等提出数字孪生协同强化学习框架 TwinRL,可在真机高效执行在线强化学习。它用手机构建数字孪生,让机器人先探索再真机操作,20 分钟达 100%成功率,比现有方法快 30%,还降低人类干预。
像开发软件一样造世界,Agent2World来了,把世界模型做成可运行的符号环境
为让模型真正“能行动”,需可执行、可验证的符号世界模型,但现有自动生成路线有困局。研究团队提出 Agent2World,经实验验证有显著效果,能稳定产出高质量符号世界模型,开辟 AI 理解现实环境新可能。
Codeforces难题不够刷?谢赛宁等造了个AI出题机,能生成原创编程题
LiveCodeBench Pro团队推出AutoCode框架,利用LLM自动化竞赛编程问题创建与评估。该框架结合验证器 - 生成器 - 检查器框架与双重验证协议,在测试用例生成上可靠性佳,还能生成新问题,同时揭示了LLM在创作上的优劣势。
美刊网使用介绍(2024版)
美刊网是一个鼓励内容推荐的平台,用户通过推荐文章赚取奖励,还能通过转发提高排名,获得更多收益。
寻找最强具身大脑!全球机器人顶会ICRA开启报名,智元全程陪跑带你拿奖
由智元主办的AGIBOT WORLD CHALLENGE @ICRA 2026赛事开启报名,设推理 - 操作和世界模型两赛道。智元提供顶配硬件、仿真平台、数据集和基线模型,还有超百万美元奖金与资源,助力开发者。
一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”
NVIDIA 推出多模态大模型 OmniVinci,结合架构创新与合成数据流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发“假开源”争议。
Artificial Analysis:DeepSeek成为世界前二AGI实验室
模型与API独立分析公司Artificial Analysis对DeepSeek R1-0528评估显示,其一举超越xAI、Meta等,与谷歌并列全球第二大人工智能实验室,在多方面性能提升,缩小了开源与闭源模型差距。
把 RAG 做成主流的公司,现在开始“做空”RAG 了
向量数据库开创者 Pinecone 宣布 RAG 时代结束,推出面向 Agent 的知识引擎 Nexus。它认为当前 RAG 模式脆弱、缓慢且昂贵,提出“知识编译”概念,称能提升任务完成率、降低 token 开销,虽面临质疑,但方向明显。