「RL环境」共找到 717 篇相关文章
美团智能体SOTA模型LongCat-Flash-Thinking-2601开源
美团龙猫团队开源智能体推理模型LongCat - Flash - Thinking - 2601,总参数5600亿。该模型在多方面有卓越表现,团队通过构建数据、模拟环境、采用强化学习策略及设计高效架构等,使其比肩闭源模型。
从「会说」迈向「会做」,LLM下半场:Agentic强化学习范式综述
过去LLM训练多依赖PBRFT范式,但局限明显。2025年初起,Agentic RL新范式受关注。此综述论文梳理该方向,覆盖500+研究,构建理论框架,讨论未来挑战,助LLM从「会说」迈向「会做」。
AI 浏览器还没捂热,给 Agent 用的浏览器已经来了:Ego Lite
最近出现了给 Agent 用的浏览器 Ego Lite。与给人类用的 AI 浏览器不同,它让浏览器成为 Agent 工作台,有隔离任务空间,不打扰用户,解决了任务和执行环境间的距离问题。
从科学论文自动生成视频
该项目解决学术演示两核心问题,用智能体PaperTalker生成视频,还设Paper2Video基准评估。介绍了PaperTalker使用步骤,含环境、配置、推理,也说明了Paper2Video评估指标及运行方法。
Databricks与OpenAI合作:企业级私有化GPT-5来了
OpenAI和Databricks深度合作,将把GPT - 5等模型原生集成到Databricks平台。企业可在自有数据环境运行模型,通过SQL等调用,Mosaic AI Gateway保障数据安全,多家企业表示期待。
字节真的要干生态了?Coze竟然开源了
字节开源 Coze Studio 和 Coze Loop,此时 Dify 等已在 Agent 基础设施赛道站稳。Coze Studio 提供 AI Agent 开发环境,Coze Loop 负责优化平台,技术栈扎实。开源版功能有删减,字节野心是抢占生态范式。
真卷啊,AI编程老祖Devin估值反超Cursor了
AI编程赛道竞争激烈。Devin开发商Cognition年化收入逼近10亿美元,新融资估值目标400亿美元,将反超Cursor。其收入倍数收窄,有真实增长,新技术能3秒配好开发环境,产品走智能体路线。
阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜
阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。
用 Codex 拯救我的 Mac
作者从2008年开始用Mac办公研发,历经系统更迭未重装。现因系统更新,不少程序是Intel版,用Rosetta 2转接,很混乱。介绍用Codex清理开发环境、更换M芯片版本Homebrew的方法。
邱锡鹏老师团队发布VehicleWorld:让智能汽车真“智能”
邱锡鹏老师团队发布论文,构建高度仿真的智能座舱虚拟环境VehicleWorld,并提出基于状态的函数调用(SFC)方法。实验显示,SFC大幅提升任务执行准确率和效率,还构建了Vehicle Benchmark进行评估。