「RL 优化技术」共找到 3972 篇相关文章
Cursor AI 上下文管理的秘诀
Cursor发表《Dynamic context discovery》文章,讲述上下文管理秘密,提出“动态上下文发现”模式,分享五个优化手段,如长输出变文件、聊天历史变档案等,还阐述了为何用“文件”及相关思考。
手残党跪了,Pi 0.6机器人15分钟学会拧螺丝,能进厂边干边学了
具身智能领域 Physical Intelligence 公布新进展,借助「RL token」法,让机器人短时间掌握精细操作。该方法给 VLA 加「外挂」,使机器人进化快、学习效率高,在多项任务测试中表现出色。
Meta新任副总裁:Manus创始人肖弘,90后
Meta正式收购AI智能体初创公司Manus,创始人肖弘出任Meta副总裁,交易金额或达数十亿美元。Manus技术强、营收高,其加入将助Meta打造AI产品,收购具象征意义。
Stanford、Meta和Google等发现LLM存在五大天花板,再扩算力已无用
论文《On the Fundamental Limits of LLMs at Scale》指出,LLM性能提升有理论天花板,扩展中会遇幻觉、上下文压缩等五大根本限制,源于计算、信息与学习理论,未来应转向‘有限优化’。
从 Serverless 到 Agent:Cube 系统的一些设计思考
本文从 Serverless 面临的挑战出发,介绍 Cube 系统设计,包括分布式调度、资源池化等。还探讨其在 Agent 场景应用,如极速代码执行、高并发 Agentic RL 等,最后展望向行业开源,助力 Agent Infra 发展。
自动化评测的九九归一——评测agent
本文提出统一评测Agent架构,实现评测全链路自动化。它能学习标注标准,完成自动标注等工作。还介绍架构、解耦方法、模型优化及训练方案,解决多模态幻觉等问题,提升机审率,节省标注成本。
The Batch: 898 | Copilot 用户需求随时间变化
微软研究表明,人们在深夜用手机和工作日白天用笔记本电脑时,对Copilot使用方式不同。研究分析3750万次对话,发现主题和意图因设备、时间、年份而异,AI社群或需重新考虑聊天机器人设计。
刚刚,OpenAI四位华人学者集体被挖,还是Meta重金出手
Meta在发布Llama 4后开启大规模招聘,再聘四名OpenAI研究人员。这些研究员是OpenAI模型研发中坚力量,暂不知是否影响GPT - 5,Meta相关技术能否提升也待观察。
黄仁勋GTC2026:龙虾是个人AI操作系统,每个企业都要围绕它来建设,2027营收有望突破1万亿美金
英伟达GTC2026发布会结束,黄仁勋将2027年前需求预测提至1万亿美元。会上发布多项技术与产品,如开源AI智能体框架NemoClaw、太空数据中心Space - 1等,还提及自动驾驶合作进展。
谢赛宁「踩雷」背后,竟藏着科研圈更黑真相:Science实锤论文造假+AI滥用!
《Science》揭露科研圈两大乱象:一是‘论文工厂’形成产业链,编辑、作者、中介相互勾结;二是ChatGPT渗入科研写作,22%计算机论文含AI痕迹。系统性造假与技术滥用,正重塑学术界根基。