Next-Token推理」共找到 2531 篇相关文章

算法论文8

LLM-in-Sandbox:给大模型一台电脑,激发通用智能体能力

来自中国人民大学、微软研究院和清华的研究者提出LLM - in - Sandbox范式,让大模型在代码沙盒完成任务,实验显示其能提升多领域表现,无需额外训练,还能减少token消耗,研究者认为应取代纯LLM推理

机器之心
新闻资讯7

Gemini 2.5 Pro 负责人:最强百万上下文,做好了能解锁很多应用场景

谷歌DeepMind长上下文预训练联合负责人Nikolay Savinov在播客中分享Gemini 2.5长上下文技术。他认为长上下文能革新产品交互,与RAG协同,未来千万级token上下文将成标配,但当前百万级未达完美时扩规模意义不大。

Founder Park
开源动态8

MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding

文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。

GiantPandaLLM
产品应用7

Claude Sonnet 5:更强,但更贵,每任务成本反超Opus 4.8

Anthropic 发布的 Claude Sonnet 5 智能指数追平 GPT - 5.5,但每任务成本比 Opus 4.8 贵 15%。它在知识工作类任务表现佳,推出促销价,不过促销后成本待察。评估迁移时需算 token 消耗。

AI工程化
算法论文7

阿里、南开大学发布免训练,视频大模型创新压缩方法

视频模型序列化处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。

AIGC开放社区
算法论文8

半量工具,双倍效能:ARPO革新大模型强化学习

大语言模型在多轮工具调用场景有挑战,传统强化学习算法有探索效率低和资源消耗大问题。本文提出ARPO,通过量化token熵分布变化设计自适应探索机制,降低工具调用成本且提升多轮推理性能。

深度学习自然语言处理
算法论文8

MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B

微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。

量子位
产品应用8

面壁MiniCPM-SALA模型,稀疏-线性注意力,单卡吞吐百万上下文

面壁智能团队提出SALA,基于此训练的MiniCPM-SALA模型,在单张A6000显卡实现百万token超长上下文推理,训练成本降约75%。它结合稀疏与线性注意力,采用混合架构,继承权重降低成本,在长文本处理上优势明显。

AIGC开放社区
算法论文7

大模型的第一性原理:(三)信息论篇

本文从信息论角度解读大模型第一性原理。介绍Shannon信息论,提出将其从以BIT为中心转换为以TOKEN为中心解释大模型底层原理,还阐述大模型各阶段信息论原理、定向信息计算方法,对比Granger与Pearl因果。

机器之心
算法论文8

NVIDIA港大MIT联合推出Fast-dLLM v2:端到端吞吐量提升2.5倍

自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,端到端吞吐量最高提升 2.5 倍,精度相当。

机器之心