「自我奖励训练」共找到 2494 篇相关文章
第二代AI预训练范式:预测下个物理状态
英伟达科学家 Jim Fan 发布《第二代预训练范式》,指出当前以 LLM 为代表的第一代范式应用于物理世界时「水土不服」,认为第二代范式是「预测下一个物理状态」,引发机器学习社区讨论。
从「自我进化」到「DAA」,百度给出 Agent 时代系统答案
2026 年 AI 行业发展微妙,模型能力增强但转化为生产力的企业不多。Create 2026 上百度给出两层答案,构建系统能力,提出 DAA 度量 AI。这是过去三年判断的收束,将非共识整合成面向 Agent 时代的方法论。
Vibe Coding 是中年男人的钓鱼
文章指出中年男人生活身份叠加,缺乏自我主宰体验。AI 如钓鱼般成他们合法体面的独处方式,降低创造门槛,让他们重获创造快感,享受自我空间。
AI游戏生成迎来「机制觉醒」:可自我进化的玩法设计师
文章指出当前大模型生成游戏存在玩法创新不足、评分虚高等问题。CreativeGame技术关注此问题,通过先写设计文档、激发创意、设计记忆架构等方式,让AI围绕机制持续迭代,探索可解释、可追踪、可迭代的创作范式。
训练机器人方式对了吗?英伟达DreamZero双榜第一新反思
NVIDIA的DreamZero在RoboArena和MolmoSpaces基准测试双登顶。分析文章《Why is DreamZero so good at robotics?》从多维度拆解其表现突出原因,质疑传统认知,如数据量并非万能,模型规模和信息输入方式也很关键。
Claude 和 Manus 还要人工搭框架?小米直接让 Agent 自我进化
6月12日小米Darwin Agent Team发布论文《HarnessX》,用“系统自进化”终结Harness人工调优时代,带来性能跃升。其让Harness成为“一等公民”,有可组合等特质,还能与模型协同进化,虽有局限但成热门方向。
重磅!Google 推出AlphaEvolve 实现算法自我进化,将颠覆数学与计算机科学!
Google DeepMind发布革命性的Gemini驱动编码代理AlphaEvolve,能设计并优化算法。它发现更快矩阵乘法算法、解决开放性数学问题,还优化了Google多方面计算基础架构,未来跨领域应用前景广。
真·养虾!3步让龙虾边聊边进化,不用GPU不用数据集就能强化学习
程序员给智能体套在线强化学习系统MetaClaw,把用户与AI对话变训练数据。它基于Kimi - 2.5,用SkillRL框架,不依赖本地GPU,训练交Tinker云平台,三步即可上手。
无需训练,直接「算出」最强AI!理想汽车发现端侧Scaling Law
理想汽车基座模型MindVLA团队与国创决策智能技术研究所联合发布论文,提出面向端侧大语言模型的「硬件协同设计扩展定律」,解决大模型部署在端侧设备的难题,实现软硬协同设计,提升模型性能和研发效率。
合合信息:基于 JuiceFS 构建统一存储,支撑 PB 级 AI 训练
合合信息为应对AI训练存储挑战,引入JuiceFS构建统一存储架构,结合BeeGFS作缓存。该架构提升I/O性能与资源调度效率,还通过缓存优化、数据治理等措施,支撑多业务并发,为AI基建奠基。