「R2版本」共找到 2379 篇相关文章
Gemini CLI 新升级:深度集成 VS Code,终于不用在终端和编辑器之间反复横跳了
Google发布Gemini CLI重要更新,实现与VS Code深度集成,从架构层面解决AI编程助手的上下文感知问题。新版本有工作区上下文感知和原生差异对比界面两个核心功能,还给出部署要求。
大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO
本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。
AI百人榜刷屏,小扎照单全收?辛顿Ilya师徒霸榜,第二名竟是本科生
Top 100人工智能名单出炉,Ilya登顶,Hinton家族两人入选,图灵排名第六。78人有博士学位,排名第2的是本科生。清华等国内大学校友多人入选,该名单疑似启发自扎克伯格的机密人才名单。
如何将LLM的"思考习惯"迁移到视觉领域?
传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。
微软深夜发布SambaY架构,Phi-4min加速10倍推理
微软基于Phi-4-mini版本,针对特定推理任务微调出Phi-4-mini-Flash-Reasoning 3B模型,将其扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行快10倍,有诸多优点。
谷歌太壕了!编程Agent大招至简:开源且免费,百万上下文、多模态、MCP全支持
谷歌开源免费的编程Agent Gemini CLI,提供业界最高免费限额,能在终端访问Gemini。其能力多样,涵盖代码理解等,支持百万上下文、多模态和MCP,开源协议为Apache 2.0,还给出安装和使用指引。
灵初智能陈源培:一个 00 后的机器人之梦
00 后陈源培是灵初智能联创,本科土木工程专业,大二因比赛对机器人感兴趣。他研究灵巧手,参与开源项目,灵初发布相关模型。他认为强化学习对灵巧手重要,还谈了模型、创业、落地等看法。
苹果OS全家桶12年最狠升级!AI入侵一切,唯独Siri没更
春季WWDC开幕,苹果OS全家桶迎十多年最大版本升级,统称OS 26。苹果AI进化,支持实时翻译、看屏搜物等。开发者工具升级,三行代码可调用苹果AI。各系统在设计、功能上均有革新。
DeepSeek用的GRPO有那么特别吗?万字长文分析四篇精品论文
文章解读 Kimi k1.5、OpenReasonerZero、DAPO 和 Dr. GRPO 四篇论文,分析 DeepSeek R1 里 GRPO 及改进算法。指出 GRPO 非特殊 RL 算法,当前 RL 算法实现相似,变革聚焦价值函数取舍等核心维度。
AI开始玩乐高了?我拼一小时的乐高,它几秒就搭好,LegoGPT开源了!
卡内基梅隆大学提出LegoGPT,是首个依文本提示生成物理稳定乐高积木模型的方法。构建了StableText2Lego数据集,训练自回归大模型生成设计,还开发纹理生成法,设计能手动或机器人组装。