「推理token」共找到 2499 篇相关文章
国产推理芯片,赢了英伟达?
算力市场风向生变,国产算力崛起。政策从资金、市场、规则多维度发力,为国产算力扫清障碍。在推理场景中,国产方案性价比更高。其独特分销体系使贸易环节信息透明度低,步入卖方市场,市场也迎来新局面。
按token 计费,真的合理吗?
马克斯·普朗克软件系统研究所论文揭露,同样文本可被切分成不同数量token,用户难以验证是否被多收费。研究团队开发算法展示服务商多收费手段,还指出按字符计费可解决问题,但需行业达成共识。
国产算力正在进入Token标准化时代
2026年6月17日,是石科技攒局国产异构算力创新发展论坛。其创始人闫博文认为国产算力瓶颈在工程化转化能力。是石科技正将异构算力转化为标准化Token生产能力,还启动B轮融资。
DeepSeek被曝自研AI推理芯片
据路透社报道,DeepSeek 正开发自研 AI 推理芯片,欲降低对英伟达和国产芯片依赖。此为重大战略转变,影响英伟达股价。虽有降本等好处,但面临技术、制造、生态等挑战。
让大模型异步地增强推理能力
在大模型推理时代,Test - Time Scaling成提升能力重要方向,但面临效率问题。ATTS提出异步框架,加入共形预测筛选候选路径,实验显示其加速显著,将测试时扩展推进到‘有原则加速’阶段。
大概念模型:AI 推理的新范式
大概念模型(LCM)是自然语言处理新范式,侧重结构化推理和理解,与 LLM 不同。它依赖结构化知识,可模拟专家思维,解决当前 AI 缺陷,文章还介绍其架构、应用、局限,探讨与 LLM 结合的未来发展。
谷歌Gemini Diffusion:1500 token/秒,快如闪电!
谷歌DeepMind在I/O 2025上推出实验性模型Gemini Diffusion,将扩散技术用于文本生成。它每秒能生成约1500个token,比Gemini 2.0 Flash - Lite快5倍,具备高响应速度、文本连贯性等优势。
蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理
医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。
谷歌揭秘:Multi-Agent 推理时扩展才是未来。
谷歌DeepMind和MIT联合发表论文TUMIX,指出Multi - Agent是推理时扩展的最佳方式,以低成本大幅提升准确率。实验表明Agent多样性优于重复采样,还展示TUMIX机制、实战表现,且LLM能设计更强Agent。
并行革命,32倍吞吐量跃升!英伟达Helix架构突破百万Token推理瓶颈
英伟达推出受DNA结构启发的Helix并行技术,能解决大模型处理长任务时的卡顿问题,提升上下文长度、并发能力并降低响应延迟。不过也有人认为其技术与实用性有差距。