推理token」共找到 2522 篇相关文章

算法论文8

ICCV 2025 | EPD-Solver:西湖大学发布并行加速扩散采样算法

扩散模型成生成任务主流技术,但逐步去噪机制致推理延迟大。西湖大学提出 EPD - Solver 算法,融合三类加速思路优势,可减少积分误差、提升生成质量,还能作插件集成,突破扩散模型速度与质量权衡瓶颈。

机器之心
开源动态8

深夜开源首个万亿模型K2,压力给到OpenAI,Kimi时刻要来了?

昨晚,月之暗面发布并开源 Kimi K2 大模型,同步上线更新 API,价格 16 元/百万 token 输出。它超过多个开源和闭源模型成新 SOTA,展示出领先能力,还介绍训练关键技术,或成模型智能进化关键。

机器之心
新闻资讯8

微软刚发布Mu模型:支持Windows智能体,小参数跑出10倍性能

今天凌晨微软发布创新小参数模型Mu,3.3亿参数性能比肩Phi - 3.5 - mini,体量小10倍,离线NPU笔记本每秒超100 tokens响应。它支持Windows智能体,架构有多项创新,经训练优化后智能体表现出色。

AIGC开放社区
新闻资讯8

OpenAI深夜数连发:o3降价80%,o3-pro上线,奥特曼最后一次手发长文,开源模型却延期了……

OpenAI昨夜动作不断,o3模型降价80%,o3 - pro发布,开源模型延期。Sam Altman发长文《温和奇点》,预测AI发展时间线。o3价格虽降但使用成本仍有差异,o3 - pro性能强却推理慢,开源延期引发猜测。

AGI Hunt
算法论文8

扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
算法论文8

成本暴降88%!通义实验室、北大发布ZeroSearch,无需搜索即可激活LLM检索能力

信息检索能力对提升大语言模型推理表现至关重要,但现有方法在训练中面临文档质量不可控和搜索 API 成本高昂两大挑战。为此,通义实验室和北大提出 ZeroSearch 框架,无需真实搜索即可激活 LLM 检索能力,显著降低成本。

机器之心
开源动态7

LightLLM中DeepSeek V3/R1 Two MicroBatch Overlap 实现解析

文章围绕LightLLM中DeepSeek V3/R1的Two MicroBatch Overlap实现展开。介绍了该技术原理,通过拆分推理过程、精心设计执行顺序实现计算与通信重叠。还阐述了数据结构设计、预处理、核心执行流程,以及优化策略和配置启用方式。

GiantPandaLLM
产品应用9

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

本文深度解读DeepSeek最新发布的V4.1 Flash大模型,详解其全新CED架构与第二代压缩稀疏注意力CSA2,揭秘其通过架构创新大幅压缩KV缓存、降低显存算力成本,在长上下文Agent场景实现性能反超的细节。

AI科技评论
推荐文章7

大模型之外,向量存储如何支撑 Agent 的检索链路

文章指出大模型负责理解、推理和生成,而Agent需获取外部数据等。向量存储可将数据转化为语义向量,在Agent执行任务时找回相关内容。文章探讨向量存储技术方向,分享做法,还演示阿里云两种Serverless向量存储用法。

阿里云开发者
新闻资讯8

Fable 5手搓首个CUDA「超级内核」!2.5小时狂飙18.7倍

在GPU算子基准测试KernelBench - Mega中,Fable 5全程纯手搓CUDA,速度狂飙18.7倍,把GPT - 5.5甩开4倍多。它写出史上首个‘超级内核’,2.5小时约55万token完成编写。Anthropic联创称这标志‘RSI循环’开启。

新智元