「省Token策略」共找到 1560 篇相关文章
上下文窗口限制被打破:Subquadratic推出了一个1200万Token的窗口
2026 年前沿模型宣传至少 100 万 Token 上下文窗口,但利用不佳。Subquadratic 推出能处理 1200 万 Token 窗口的模型,称可绕过问题,还将推 5000 万窗口模型,其 SSA 架构有优势,基准测试成绩佳。
重新思考 AI TCO:为何每 Token 成本才是唯一重要的指标
在生成式与代理式AI时代,传统数据中心转变为AI Token工厂,企业评估AI基础设施时不应只关注算力成本、每美元FLOPS,而应重视每Token成本,它决定AI规模化盈利,NVIDIA在该指标上表现出色。
腾讯太极团队实现DeepSeek模型业内H20最高性能15800+ tokens/s
腾讯太极团队揭秘实现DeepSeek模型15800+ tokens/s业内H20最高性能的方法,通过PD分离、多层MTP优化等全栈优化方法论,还介绍多机性能优化方案,后续预计性能突破20000 tokens/s。
从混沌到可控:企业应用中AI Agent不确定性控制的 10 种策略
大语言模型输出的不确定性限制了AI智能体在企业场景的应用,本文总结控制生成式AI Agent不确定性的常见策略,涉及技术、应用设计、管理与治理层面,还推荐了相关作品。
谷歌月Tokens消耗量领跑全球了:1300000000000000(别数了是千万亿)
谷歌月处理Tokens用量达1.3千万亿,较一年前的9.7万亿大幅增长。横向对比,谷歌在该指标上远超微软等大厂。Tokens消耗量可衡量模型多方面能力,谷歌为行业树立新标杆。
Token需求狂飙千倍,22亿热钱涌向这家AGI Infra头号玩家
在AI基础设施成风口的背景下,国内AGI Infra头部玩家无问芯穹获超7亿融资,其Token调用量爆发式增长。随着AI产业进入Agent阶段,传统架构难适配新需求,无问芯穹以中立定位成Token经济枢纽。
图解Vllm V1系列5:调度器策略(Scheduler)
本文是图解Vllm V1系列5,聚焦调度器策略。先回顾vllm v1整体运作流程,接着阐述调度 - 推理的整体流程,包括将请求添加进Scheduler、Scheduler单步调度策略等,还对比了不同场景下的函数及调度逻辑。
深刻理解Token:大语言模型(LLM)是如何看待这世界?
文章指出在大语言模型(LLM)中,Token是处理文本的基本单位。介绍了Token的概念、分词方法、向量化过程,还阐述了分词对模型性能的影响,如导致模型在数学、多语言处理上表现不佳等。
AI开始替人类调用AI!token用量已是人类5.2倍
据OpenRouter统计,截至8月10日,Agent类token用量半年涨14倍,人类仅2.8倍。差距源于用法差异,虽智能体部分token计价低,但用量大仍烧钱。省钱关键在配套,且智能体任务验收缺人手。
国内首次!8.9毫秒推理速度破纪录,1元打穿百万token
在2025人工智能计算大会上,浪潮信息发布元脑SD200和元脑HC1000两款AI服务器。前者让DeepSeek R1的Token生成速度达8.9毫秒,后者将推理成本降至1元/百万Token,解决了AI智能体速度与成本难题。