Token产出」共找到 746 篇相关文章

推荐文章7

Mini-sglang-01:从Client到Scheduler的消息流转之旅

文章围绕轻量化大模型推理系统mini - sglang,详细介绍消息从客户端经APIServer、Tokenizer到Scheduler的流转过程,分析核心组件功能、消息体系、正反向链路及优化策略,还预告后续分析调度和模型实现逻辑。

GiantPandaLLM
推荐文章7

大模型的第一性原理:(二)信号处理篇

本文从信号处理角度解读大模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出大模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。

机器之心
推荐文章7

被喷了……我索性扔出价值过万的 AI 编程 prompt

作者因招聘要求被喷,索性分享价值过万的 AI 编程 prompt。介绍招聘需把控 AI 产出质量,还讲了完整表达需求、完善文档、过程监督等编程要点,最后给出杀手级 prompt 并预告下文。

AGI Hunt
算法论文8

LightMem用3招重新设计了LLM的记忆,结果出乎意料

LLM在超长多轮对话中有上下文窗口有限、记忆系统昂贵的痛点。LightMem借鉴人类记忆机制,用三招重新设计LLM记忆,实验显示其准确率超基线,还降低token使用量、API调用和运行时间。

PaperAgent
算法论文8

快手Klear团队提出CE-GPPO:通过梯度保留协调熵,解决强化学习中的熵不稳定问题

快手 Klear 语言大模型团队提出新强化学习算法 CE - GPPO,以「熵」为核心,提出梯度保留策略,重新利用裁剪外区间低概率 token 的梯度,实现策略熵的精细调控,解决强化学习中熵不稳定问题。

机器之心
推荐文章7

AI 炮制的“工作垃圾”,正在摧毁你的生产力

尽管生成式AI在工作场所使用激增,但多数公司难见可衡量的投资回报率。原因可能是AI工具产出“工作垃圾”,表面光鲜却空洞。文章分析现象、影响,并为组织提出避免“一刀切”等应对原则。

宝玉AI
算法论文8

DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍

扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。

机器之心
算法论文8

扎克伯格的豪赌初见成效?Meta新方法让LLM长上下文处理提速30倍

Meta Superintelligence Labs提出REFRAG高效解码框架,解决LLM长上下文输入效率瓶颈。它通过四步流程优化解码,让首个token生成时间加速达30.8倍,扩展上下文,且精度不降反升,不过价值待实际检验。

机器之心
算法论文7

EMNLP 2025 浙大&蚂蚁 | 提出动态压缩CoT推理新方法:LightThinker

随着AI发展,大语言模型处理复杂推理任务能力提升,但推理时产生大量中间步骤和文本,拖慢计算速度、增加资源压力。浙大、蚂蚁等机构研究者提出LightThinker,可动态压缩推理步骤,降低内存占用和计算成本。

AINLPer
新闻资讯7

AI顶会反噬整个学术圈!「不发表就会死」,NeurIPS爆仓,博士年肝4.5篇大崩溃

NUS研究者指出,NeurIPS等AI顶会投稿量激增,正反噬学术圈。当前模式存在结构性危机,如学术产出泡沫化、环境代价高、研究者心理负荷大等。为此,他们提出“社区联邦会议”(CFC)模型以解决问题。

新智元