「RL token」共找到 901 篇相关文章
黄仁勋:龙虾就是新操作系统!英伟达7种芯片拼出算力怪兽,放话2027营收万亿美元
英伟达GTC 2026上,黄仁勋回顾发展历程后预计2027年营收至少达1万亿美元。介绍Token工厂经济学,推出Vera Rubin系统,还谈及OpenClaw,断言企业IT逻辑将改写,也预告了Feynman架构和太空数据中心。
五源投资人笔记:Agent 是新生命,它今天很饿|5Y View
五源投资人石允丰认为,Agent是新生命,以OpenClaw为例,它持续运行,有心跳、记忆等特征且消耗大量token。这引发AI市场“双链分裂”,代谢链潜力大,还带来可靠性、编排等投资机会。
拿着做数学题的 PRM 来评判 Agent 调用工具,基本是行不通的!
目前评估体系多为结果导向,在工具调用上缺乏像样的PRM基准。Arizona State University和Intuit AI Research研究者推出ToolPRMBench,指出用做数学题的PRM评判Agent调用工具行不通,还介绍了其构建方法、训练范式和实验结果。
AI鸿沟正在拉大!OpenAI报告揭示:不用AI的企业将被淘汰
12月8日OpenAI发布2025年报告,基于百万级企业客户数据,揭示企业AI使用量爆发式增长,重塑全球商业流与组织架构。不同行业、地域加速渗透,同时企业和员工间AI鸿沟也在拉大。
沉默的进化:LatentMAS 如何通过“潜意识通信”重塑多智能体协作?
这是对多智能体协作领域突破性研究的深度解读。论文提出LatentMAS框架,让智能体直接交换“思维向量”,实现“机器心灵感应”,在性能、速度和Token消耗上全方位碾压传统文本交互模式。
算力成本大降!马尔可夫思考机来了,LLM推理成本直接降为线性
用强化学习让LLM具备推理能力耗费颇高,计算量会二次级增长。Mila和微软研究院等团队提出马尔可夫式思考机,重构强化学习形式,让计算量呈线性,实验效果显著,还能与先进模型兼容。
出价算法新SOTA——快手首提生成式强化学习出价
文章介绍快手新提出的生成式强化学习出价模型GAVE,回顾出价算法发展历程。GAVE结合生成式与强化学习优势,有Score-based RTG等创新,经竞赛、实验验证效果佳,为出价技术带来新方向。
谁在重新定义 AI 云?
过去几年,AI成云计算行业统一叙事,但厂商口号趋同,差异化消解。当下AI从“炫技”走向“应用”,华为云在全联接大会2025上提出新组合,回应行业成本、基建和应用难题,不过路径也面临挑战。
外卖公司也能搞AI?
昨天凌晨美团悄悄开源560B参数的MoE大模型LongCat-Flash-Chat,引发国外网友疑惑。该模型推理速度超100 tokens/秒,基准测试表现出色,多项设计解决实际问题,贴合美团业务需求。
强化学习也遇到了“天花板”?Andrej Karpathy构建了一个新算法
大神Karpathy肯定强化学习(RL)价值,指出其比监督微调更具扩展性,但存在渐进式学习低效、背离人类学习机制的局限。他提出“第二天性”新范式算法,还面临泛化等挑战。