「token分配」共找到 744 篇相关文章
爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌
腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。
强化学习的进化:从PPO到MaxRL,LLM推理训练的算法演进史
本文概述2024 - 2026年推理LLM的强化学习进展,从REINFORCE和PPO讲起,介绍GRPO、RLOO等多种算法。指出critic模型非必需,标准差归一化有副作用,损失聚合很关键,信任域是优化切入点,还提出几个未解决的挑战。
面壁智能开源 EdgeClaw,一款安全高效端云协同的龙虾 Agent。
当下AI Agent端侧常被忽视,数据任务都涌向云端致隐私泄露和算力浪费。近期面壁智能等联合开源EdgeClaw,以三级安全和性价比感知协同机制,解决OpenClaw数据泄露、token成本高等问题。
黄仁勋:龙虾就是新操作系统!英伟达7种芯片拼出算力怪兽,放话2027营收万亿美元
英伟达GTC 2026上,黄仁勋回顾发展历程后预计2027年营收至少达1万亿美元。介绍Token工厂经济学,推出Vera Rubin系统,还谈及OpenClaw,断言企业IT逻辑将改写,也预告了Feynman架构和太空数据中心。
五源投资人笔记:Agent 是新生命,它今天很饿|5Y View
五源投资人石允丰认为,Agent是新生命,以OpenClaw为例,它持续运行,有心跳、记忆等特征且消耗大量token。这引发AI市场“双链分裂”,代谢链潜力大,还带来可靠性、编排等投资机会。
DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透
DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出全新范式及Engram模块,解决传统N - gram问题,研究稀疏性分配,验证推理能力提升,兼顾工程优化。
AI鸿沟正在拉大!OpenAI报告揭示:不用AI的企业将被淘汰
12月8日OpenAI发布2025年报告,基于百万级企业客户数据,揭示企业AI使用量爆发式增长,重塑全球商业流与组织架构。不同行业、地域加速渗透,同时企业和员工间AI鸿沟也在拉大。
沉默的进化:LatentMAS 如何通过“潜意识通信”重塑多智能体协作?
这是对多智能体协作领域突破性研究的深度解读。论文提出LatentMAS框架,让智能体直接交换“思维向量”,实现“机器心灵感应”,在性能、速度和Token消耗上全方位碾压传统文本交互模式。
RL 是新的 Fine-Tuning
今年 9 月,Thinking Machines 研究使 LoRA 重获重视。OpenPipe 创始人 Kyle Corbitt 访谈指出,多数场景微调 ROI 低,RL 将融入 agent 生命周期成主流,但 RL 落地难在环境搭建,World Model 或为关键。
算力成本大降!马尔可夫思考机来了,LLM推理成本直接降为线性
用强化学习让LLM具备推理能力耗费颇高,计算量会二次级增长。Mila和微软研究院等团队提出马尔可夫式思考机,重构强化学习形式,让计算量呈线性,实验效果显著,还能与先进模型兼容。