「MCP·RL」共找到 857 篇相关文章
RLinf上新πRL:在线强化学习微调π0和π0.5
近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。
直播预约 | “年鉴展·艺术与科技”主旨演讲&研讨会第二场将于12月14日举行
“年鉴展·艺术与科技”展览正在798艺术区举行,展至12月19日。12月14日16:00 - 18:00将举办第二期主旨演讲与研讨会,朱青生主持,费俊、刘超、张彬彬将探讨艺术与科技多方面问题。
无需SFT也不用RL,样本级推理优化神器SLOT来了,准确率轻松+10%
西湖大学MAPLE实验室开发的SLOT方法,无需SFT和RL,让模型推理时“临时学习”具体问题。它简单易实现,计算开销小,能使模型准确率大幅提升,还无需额外资源,在各规模模型上效果显著。
GPT-5≈o3.1!OpenAI首次详解思考机制:RL+预训练才是AGI正道
OpenAI研究副总裁Jerry Tworek在播客访谈中称,GPT-5类似o3.1。他详解模型推理过程,强调RL+预训练是AGI正道,肯定DeepSeek的GRPO算法,还分享自身经历及OpenAI工作结构。
计算机科学家杰弗里·辛顿:“AI会让少数人更富,多数人更穷”
被誉为‘人工智能教父’的杰弗里·辛顿,见证了AI从学术走向主流。他从技术加速者变为警示者,指出AI或对人类造成严重伤害,还谈到应对风险方案、中国优势及AI对社会经济的影响等。
智源悟界·Emu3.5发布,开启“下一个状态预测”!王仲远:或开启第三个 Scaling 范式
2025年智源发布悟界·Emu3.5,在“Next-Token Prediction”基础上实现“Next-State Prediction”。它能力全面提升,或开启第三个Scaling范式,还在预训练、强化学习、推理加速上有技术创新。
2026 年,万物皆 Coding Agent 的平台工程新范式(A2A / ACP / MCP / Skill)
过去 DevOps 工具链复杂,如今 AI 重塑其为 Coding Agent。借助 A2A、ACP、MCP 和 Skill,可构建 Agent 网络。文章分析平台工程演进,介绍相关协议,对比编排模式,还给出 Routa 编排架构实践参考。
20000 GPU·h砸出 106 个SOTA模型架构:AI 科研进入“自我加速”时代
模型架构发现领域迎来突破,ASI - ARCH超级智能体无需人类预设搜索空间,完成科研闭环。经20000 GPU·h、1773次实验,发现106个超越人类SOTA的线性注意力架构,且已开源。
蚂蚁·安诊儿医疗大模型:正式开源并登顶权威医疗榜单
近日,蚂蚁集团联合浙江省卫生健康委开源自研的蚂蚁·安诊儿医疗大模型。它基于蚂蚁百灵大模型架构,经深度训练,是参数规模最大的开源医疗模型。该模型在多评测中表现出色,有三阶段训练流程,架构高效、推理快,已开源助力行业发展。
AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用
深势科技推出玻尔·跃迁实验室,解决传统实验室设备割裂、经验依赖、数据离散、部署低效等痛点,围绕计算 - 实验 - 数据 - 计算无缝闭环底层重构,与传统 ELN/LIMS 不同。