规模化RL」共找到 409 篇相关文章

推荐文章7

LLM学习笔记:最好的学习方法是带着问题去寻找答案

文章总结拓展Andrej Karpathy教学视频,分析大模型聊天流程与原理,介绍LLM训练步骤,包括预训练、后训练和强化学习,还提及主流特性应用,如文件上传、网络搜索,强调带问题学习的重要性。

腾讯技术工程
推荐文章8

Anthropic创始人行动手册:打造一家AI-Native创业公司(附36页中文PDF)

Anthropic上周发布《创始人行动手册》,介绍AI时代打造AI - Native创业公司的方法。手册按创业四阶段展开,阐述各阶段目标、挑战及Claude工具的使用,还给出资源、案例和创业支持信息。

花叔
推荐文章8

明略科技吴明辉:企业级Agent的“精度陷阱”与人机协同重构之路

2025 年 12 月 19 日,明略科技创始人吴明辉在 AICon 大会分享《可信 Agent 的规模化之路》。他指出企业级 Agent 存在“精度陷阱”,建议重新设计人机分工,让 AI 执行 Task,人定义目标、校验结果、审计逻辑。

InfoQ
新闻资讯8

嚯,具身智能和脑机接口在康复医疗合体了

在第二届傅利叶具身智能生态峰会上,CEO顾捷宣布给康复患者戴脑机接口设备,让机器人依脑电信号辅助康复训练。还启动“脑机具身·数据引擎联合创新计划”,圆桌环节嘉宾探讨技术影响与应用。

量子位
推荐文章8

燃尽、重启、爆火:Clawdbot 创始人的 35 分钟访谈实录

本文是 Clawdbot 创始人 Peter Steinberger 的访谈实录。他曾经营 PSPDFKit 13 年,后经历三年倦怠期。2024 年受 Claude Code 启发,10 天做出 Clawdbot,几周内 GitHub 星标近 9 万。还谈及模型看法、改名风波及产品前景等。

宝玉AI
产品应用8

一周对战2500万局,这些「AI假人」让人类游戏玩家破防了

2025年巨人网络《超自然行动组》成黑马,新玩法中游戏怪物“假人”接入AI大模型。上线一周参与近2500万场对局,成国内首个深度融合AI大模型并规模化落地的大DAU游戏。

机器之心
新闻资讯7

开盘大涨416%,市值近3000亿元,“国产GPU第一股”今日上市

12月5日,“国产GPU第一股”摩尔线程登陆A股,开盘大涨416%,市值近3000亿。它成立五年成国内代表企业,有全栈自研能力。不过,也面临国际巨头、国内竞品、供应链等挑战,且尚未盈利。

芯师爷
算法论文8

DPO与GRPO谁更胜一筹?港中文、北大等联合发布首个系统性对比研究

港中文、北大等团队首次全面对比DPO和GRPO算法在自回归图像生成中的应用,评估其在域内、域外性能,探究奖励模型及扩展策略的影响,为开发高效RL算法提供新思路。

机器之心
新闻资讯7

Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证

Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。

量子位
推荐文章7

AI正在重塑商业,信任决定未来商业能走多远丨Visa大中华区总裁张文翊

Visa大中华区总裁张文翊认为,AI正重塑商业,智能体改变商业决策,信任决定其规模化。文章阐述AI重塑商业的三个转变、需关注的三个关键词,点明中国市场重要性及Visa探索方向。

量子位