「RL Scaling」共找到 448 篇相关文章
赢家诅咒?英伟达暴跌背后的泡沫之辩
11月3日至28日,英伟达股价跌幅近15%,黄仁勋有危机意识。同时谷歌股价涨超13%,Gemini3.0重建投资者信心。行业面临‘Scaling时代终结’论断,围绕英伟达GPU折旧周期有争议,TPU路线现曙光,国产算力加速替代。
从 AI 创业角度看 GEO:如何引流、效果评估,以及创业机会在哪里?
文章从AI创业角度剖析GEO,介绍其原理、内容优化策略、实操建议、效果评估搭建、代表产品等,指出GEO与SEO不同,虽有争议但值得做,还探讨了相比SEO的更多想象空间。
全球首家具身数据独角兽诞生:光轮智能完成10亿元融资,开启具身数据规模化元年|甲子光年
具身智能进入数据Scaling Law时代,光轮智能完成10亿融资成全球首家具身数据独角兽。它构建了World-Behavior-Eval数据引擎体系,在多领域获国际交付冠军,客户涵盖顶尖企业,正构建物理AI时代基础设施。
AI Code要变天了,Meta首个代码世界模型登场!
Meta FAIR推出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和推理,code和mode已开源。在SWE - bench验证中表现优,能与更大规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。
本周六直播预约 | Test-Time Reasoning综述分享!
当大模型训练成本飙升、数据枯竭,推理阶段扩展Test-Time Scaling(TTS)成研究热点。论文提出四维正交分析框架,梳理主流技术路线,提炼发展路径,给出操作指南与未来思考,本周六将直播分享该综述。
仅隔一天,OpenAI同步上线o3和o4 mini,它们能调用ChatGPT里的多种工具,可基于图像思考。o3是强大推理模型,o4-mini专为快速经济推理优化。即日起部分会员可体验,还开源了Codex CLI。
蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据
蚂蚁集团论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获VLDB工业赛道最佳论文。其研发的OmniTable系统能管理超35PB、3050亿条以上训练数据,解决数据准备难题,如在SFT任务中大幅缩短周期。
刚刚,唐杰、杨强、杨植麟、林俊旸和刚回国的姚顺雨坐一起都聊了啥?
1月10日AGI - Next前沿峰会上,智谱AI唐杰、月之暗面杨植麟等大模型掌舵者及学界泰斗罕见同台。他们探讨AI从‘聊天机器人’进化为‘干活的智能体’,但解法各异,还在圆桌激辩多个敏感话题。
这些大神在Meta的论文看一篇少一篇了
田渊栋团队剖析可验证奖励强化学习(RLVR)训练动态,戳破参数更新稀疏误区,提出三门理论说明其参数更新定位机制,还为RL训练算法设计提供指导,指出SFT时代参数高效微调方法在RLVR中迁移效果差。
Computer Use:莫拉维克悖论
2025年AI在数学证明等“高阶智能”任务表现佳,在“像人类一样使用电脑”任务却受挫,再现莫拉维克悖论。文章分析计算机使用智能体是实现AGI机会与挑战,指出发展难题、探讨RL作用并给出研究方向。