「MCP·RL」共找到 857 篇相关文章
揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路
上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。
DeepSeek Harness 入选项目疑似曝光,不选万星「花瓶」,死磕 Agent 基建
昨晚 DeepSeek V4 Pro 发布,欲迈向“工业级 Agent 生产线”。网上爆出 DeepSeek Harness 内测入选项目名单,筛选重实用功能,多集中在 MCP 插件、Coding Agent 等赛道,还介绍了部分入选项目及战略意图。
AI 创业怎么做?500+ 技术领导者给出了他们正在实践的答案| TGO 杭州十周年庆 & GTLC 杭州站
2026年6月27日,TGO杭州十周年庆·GTLC全球科技领导力大会杭州站举办,近二十位嘉宾从多领域分享。如汪源指出智能体上下文工程是瓶颈,许式伟称AI是企业“外挂”等,还有创业者展示产品。
重新审视SFT的泛化能力:优化动态、数据与模型能力的条件性分析
上海人工智能实验室等联合研究质疑了‘SFT倾向于记忆,RL实现泛化’观点,指出SFT泛化是条件性现象,受优化动态、训练数据、基模型能力影响,还揭示长思维链SFT会带来安全性能退化。
Google Stitch神了,我做周杰伦《太阳之子》播放器,2分钟后感叹前端彻底凉了
作者用Google Stitch两分钟做出周杰伦《太阳之子》音乐播放器网站,感叹前端要凉。Stitch可根据自然语言生成高保真UI,与Firebase Studio、AI Studio形成闭环。这使前端开发门槛消失,也让Figma股价下跌并推出MCP。
智能体时代的强化学习:AReaL 框架与 Agent 最佳实践
本文整理自吴翼博士在 2025 年 QCon 全球软件开发大会的分享。他介绍 AReaL 框架及 Agent 最佳实践,阐述强化学习与大模型联系,指出 Agent 是 AGI 未来 5 年关键,强化学习是 Agent 技术核心,还分享团队成果与经验。
十万美元的机械狗,正在“排泄”你的肖像!
迈阿密巴塞尔艺术展上,售价十万美元的《普通动物》由三只戴扎克伯格、马斯克和安迪·沃霍尔面具的机械狗组成,内置摄像头捕捉观众与环境,AI生成图像后“排泄”出实体作品,引发不同评价。
黄仁勋、李飞飞、Yann LeCun等六位AI顶级大佬最新对话:AI到底有没有泡沫?
六位 AI 顶级大佬黄仁勋、约书亚·本吉奥等齐聚参加峰会对话,回顾 AI 发展历程,分享职业生涯“顿悟时刻”,探讨 AI 是否有泡沫、何时达人类智能水平等问题,各抒己见展现对 AI 未来的不同思考。
Figma 如何使用 AI 来支持而不是取代设计师
Figma 在设计平台集成 AI,有自动命名层等功能,能将文本提示等转换为生产就绪代码。其 AI 功能基于早期基础设施,关键在于 Dev Mode 和 MCP 服务器,确保设计师掌控输出,降低制作软件障碍。
奖励模型也能Scaling!上海AI Lab突破强化学习短板,提出策略判别学习新范式
上海人工智能实验室提出策略判别学习(POLAR)新范式,解决奖励模型设计与训练瓶颈。POLAR可灵活适配多样需求,弥补传统奖励模型短板,契合强化微调框架,实验证明其性能和泛化性优越。