RL环境」共找到 717 篇相关文章

新闻资讯8

教科书《性能之巅》作者入职OpenAI!迷弟总裁亲自欢迎

系统性能优化领域顶级专家Brendan Gregg加入OpenAI,将参与ChatGPT性能团队。他被尊为“性能之神”,著有《性能之巅》等,发明火焰图。他自述因OpenAI环境与AI需求加入,还为圆童年科幻梦。

量子位
新闻资讯7

刚刚,OpenAI买下Python最强基建,准备垄断开发者「生产资料」

本周四,OpenAI宣布收购为软件开发者构建开源工具的Astral,其团队将加入Codex团队。Astral有Ruff、uv等重要开源工具,收购引发开发者对Python开发环境的担忧,也意在狙击竞争对手。

机器之心
新闻资讯7

JetBrains放弃Fleet:急刹变道打造全新Agentic IDE,与VS Code、Cursor争夺下一代AI编程王座

本周,JetBrains 宣布停止开发 IDE 产品 Fleet,将精力投入新开发环境 Air。Fleet 自 2021 年推出一直处预览阶段,难取代 IntelliJ IDEA。公司称维持两条产品线易致用户困惑、分散精力。

AI前线
算法论文8

别再手写 Skill 了!微软最新研究:像神经网络一样训练 Skill

微软研究提出 SkillOpt 方法,把 Skill 文档当「权重」训练,在 52 个测试组合中全部最优或并列最优,平均提升 23.5 分,碾压人类手写。该方法跨模型、环境有效,已开源,使用方便。

AGI Hunt
产品应用7

英伟达发布统一GPU开发平台DGX Cloud Lepton

英伟达发布专为开发者设计的AI平台DGX Cloud Lepton,可汇聚全球GPU计算资源,提供即时访问和无缝部署能力。它功能强大,支持多环境部署,提供统一体验,还有庞大合作网络。

AIGC开放社区
新闻资讯7

让记忆学会“进化”:探索 LLM Agent 的运行时价值感知与自适应检索 | 直播预约

本次直播将介绍最新研究成果 MemRL,提出作用于情景记忆的运行时强化学习方法,使 LLM Agent 能判断记忆价值,检索高价值经验,提升复杂未知环境下泛化性能与任务成功率。

深度学习自然语言处理
产品应用8

手残党跪了,Pi 0.6机器人15分钟学会拧螺丝,能进厂边干边学了

具身智能领域 Physical Intelligence 公布新进展,借助「RL token」法,让机器人短时间掌握精细操作。该方法给 VLA 加「外挂」,使机器人进化快、学习效率高,在多项任务测试中表现出色。

机器之心
推荐文章8

Agentic 软件工程:造 Agent 只是最简单的部分

Agno 创始人 Ashpreet Bedi 认为造 Agent 简单,让其在生产环境稳定运行才是挑战。他提出 Agentic 软件六大支柱,给出 AgentOS Docker 模板代码实践,指出多数 Agent 产品卡壳是基础设施跟不上。

AGI Hunt
算法论文8

西交大 x A*STAR 论文:让 AI 学会「保持一致」,多图生成迎来关键突破丨CVPR 2026

西安交大与新加坡A*STAR团队提出论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling 》,将一致性问题转为“跨图比较”学习问题,结合强化学习实现能力闭环,提升多图生成一致性。

AI科技评论
开源动态8

开源一周狂揽 35K 标星!Karpathy 开源 autoresearch:630 行代码让 AI 自动“炼丹”!

前OpenAI、特斯拉前AI总监Andrej Karpathy发布新项目autoresearch,一周揽35.6k Star。它是极简版LLM训练环境,630行代码让AI自动做研究,人类通过Prompt指导,AI自行实验。

开源星探