「推理性能优化」共找到 4225 篇相关文章

推荐文章8

世界模型的范式之变:因果思维链开始推演未来如何发生

本文探讨世界模型的范式变革,介绍Aether AI推出的引入因果思维链的具身世界模型CausalWM,该模型在多项公开评测中取得领先成绩,分析因果推理对具身智能落地的核心价值,展望其在多领域的应用前景。

DeepTech深科技
算法论文7

SGLang Custom AllReduce v1 与 v2 实现原理详解

文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。

GiantPandaLLM
产品应用8

智谱开启狂飙模式!7倍提速,全球最快,旗舰模型即问即答

5月22日,智谱上线GLM - 5.1高速版API,输出速度达400 tokens/s,刷新全球大模型API速度纪录,比原版提速约7倍。该速度由GLM团队和TileRT团队联合打造,核心优化分三层推进,且是稳定可用的生产级能力。

AIGC开放社区
8

全网最强万字解读:DeepSeek-V4 掀翻了谁的桌子? | GAIR live 030

文章深度解读了DeepSeek-V4,从产业、生态和架构维度拆解其效率账本。它成本低,补齐短板适配昇腾芯片,但极致省钱也有代价,如性能衰减、架构复杂等。还探讨了长上下文、MoE与稠密模型路线差异及商业化潜力。

AI科技评论
算法论文8

4步生图封神,GenEval从61%狂拉到92%,全面超越GPT-4o的TDM-R1模型来了

香港科技大学唐靖团队等提出全新通用强化学习框架 TDM - R1,仅 4 步采样就让组合式生成指标 GenEval 从 61% 升至 92%,超越 GPT - 4o。它解决少步扩散模型痛点,实现多方面性能提升,为少步生图发展带来新方向。

机器之心
算法论文8

RL特训出「押题大师」?破解模型微调中的多样性危机与灾难性遗忘

近年来,基于可验证奖励的强化学习(RLVR)成为提升大语言模型推理能力的重要路径,但许多经RL微调的模型出现‘越训越单一’问题。复旦大学等团队聚焦长期被忽视的KL散度项,提出DPH - RL方法,可缓解多样性坍塌。

新智元
算法论文8

CVPR 2026|1分钟单图变4D视频!AI看图直接脑补物理规律

北京理工大学和理想汽车等团队提出全新框架PhysGM,引入DPO实现端到端快速前馈推理,能1分钟内将单图生成为4D动态视频,在速度和评价指标上超越主流模型,相关工作被CVPR 2026接收且代码已开源。

机器之心
算法论文8

北大团队提出 SHINE:将任意文本转化为大模型 LoRA,仅需一次前向传播!

北大团队提出全新超网络架构 SHINE,仅需一次前向传播就能将任意文本转化为大模型 LoRA 参数,支持多轮对话。该方法实用潜力大、架构创新高效,训练流程成熟,推理快速,为大模型持续学习提供新思路。

机器之心
产品应用8

GPT-5.4 mini+nano突袭,1/3价格养满血「龙虾」!OpenAI彻底杀疯

OpenAI发布GPT - 5.4 mini和nano,继承GPT - 5.4优势,速度快、成本低。在编码、推理、工具调用等方面表现出色,可作为「龙虾」主力模型。还提出分层调度架构,且全线上线,免费用户也能用,但mini长上下文处理有短板。

新智元
算法论文8

Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力

上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为大模型发展提供新方向。

机器之心