「经验学习」共找到 1812 篇相关文章
Andrej Karpathy最新万字采访:AGI还需10年,RL其实很糟糕,AGI不会导致经济大爆发
Andrej Karpathy在两小时万字采访里阐述AI观点。他认为AGI还需十年,强化学习糟糕,其不会带来经济爆炸式增长。还分享创办Eureka的愿景,想构建“知识斜坡”,让人类在AI时代有更强认知力。
逆势降本:云上数据平台年复削减30%的治理实践
本文是朴朴科技对云上大数据平台成本治理的阶段性总结。其开展成本治理已三年,分“降本增效”三部曲:成本发现与分析、成本优化与控制、体系化治理构建,分享经验,助力同行开展相关工作。
Meta 将移动端消息基础设施从 C 迁移到 Rust
Meta正在用Rust逐步重写移动端消息基础设施,替换老旧C代码。内存安全、开发者幸福感和长期可维护性是迁移动机。编译核心库用于多应用,虽Rust学习曲线陡,但团队用多种方式克服,还改进工具链。
他们还没毕业,就在用AI搭建自己的世界|五源小酒馆Vol.30 x AI Native创造者
本期五源小酒馆邀请三位年轻AI Native创造者,分享AI学习与创造经历。他们谈及AI对生活工作的改变、关注的产品及模型,探讨资源分配、AGI突破等问题,还交流了未来能力培养和给十年后自己的话。
首创Mid-training范式破解RL奥秘,Llama终于追平Qwen!
上海创智学院和上海交通大学研究团队深入探讨不同基础语言模型在强化学习训练中的差异,提出中期训练策略,将 Llama 改造成适配 RL 的推理基础模型,缩小与 Qwen 性能差距,还发布了 MegaMath-Web-Pro-Max 数据集。
Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制
论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。
AI 编码 3.0:人机协作,正在走向多 Agent 协作系统化
文章指出AI编码正从2.0走向3.0,2.0解决生成问题,3.0则是执行系统。当Agent进入软件交付流程,协作需从经验驱动转向模型驱动,Kanban和Harness等工具也有了新角色,系统更强调验证和控制。
仅4人28天!OpenAI首曝Sora内幕:85%代码竟由AI完成
OpenAI团队揭秘安卓版Sora APP构建内幕,4人团队28天完成从0搭建,约85%代码由AI智能体Codex完成。Codex可自我迭代,在多方面表现出色,但也需人类指导。团队分享了与Codex协作的经验和技巧。
腾讯AI Lab首创RL框架Parallel-R1,教大模型学会「并行思维」
腾讯AI Lab等机构研究者首创Parallel - R1框架,通过强化学习让大模型掌握并行思维。它解决了RL训练的冷启动和奖励设计难题,在多数学基准上提升准确率,还揭示模型思维策略变化及并行思维的‘脚手架’作用。
黄仁勋李飞飞林斌投了同一家机器人公司
Generalist是专注给机器人“造通用大脑”的AI公司,创立不久便多次融资,估值超20亿美元。其GEN - 1.5有强大泛化能力,演示一次就能上手,但也有很大进步空间,展示了未来通用机器人大脑学习方式。