低延迟推理」共找到 2954 篇相关文章

产品应用7

设计师的 ChatGPT 时刻:Figma 这次把“设计即代码”玩成现实

文章介绍了AI编程产品分类,指出Vibe Coding存在的问题。重点讲述Figma在2025 Config发布Vibe Coding产品Figma Make,其可从设计稿生成网页,有编辑工具精准迭代等功能,还推出可视化代码建设工具Figma Site。

歸藏的AI工具箱
开源动态8

蚂蚁百灵新一代Ling-3.0开源,智效比13.2,124B释放1T能力

蚂蚁百灵新一代模型Ling-3.0开源,有flash和tiny两版本。Ling-3.0-flash参数量124B,智效比13.2,输出快成本;Ling-3.0-tiny参数量7.9B,激活少且适用多场景,二者都极致挖掘模型效率。

AIGC开放社区
算法论文7

SGLang Custom AllReduce v1 与 v2 实现原理详解

文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。

GiantPandaLLM
新闻资讯7

AI折叠!Fable 5和GPT-5.6,正沦为少数人的特权

当前AI体验出现严重“阶层折叠”,极少数人用Fable、GPT - 5.6等顶级大模型,大众用的是参数的平庸产品。算力成本让普通人难以触及顶级AI,在医疗等领域也存在使用差距,不过也有人认为普通工作无需顶级模型。

新智元
产品应用8

全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货

美团推出LongCat-2.0,是首个在国产算力上实现全链路训推闭环的万亿参数模型。它多项性能强,适配主流编程工具,架构设计原创,还证明了国产算力有支撑大模型迭代的能力,训推成本更

量子位
8

全网最强万字解读:DeepSeek-V4 掀翻了谁的桌子? | GAIR live 030

文章深度解读了DeepSeek-V4,从产业、生态和架构维度拆解其效率账本。它成本,补齐短板适配昇腾芯片,但极致省钱也有代价,如性能衰减、架构复杂等。还探讨了长上下文、MoE与稠密模型路线差异及商业化潜力。

AI科技评论
算法论文8

RL特训出「押题大师」?破解模型微调中的多样性危机与灾难性遗忘

近年来,基于可验证奖励的强化学习(RLVR)成为提升大语言模型推理能力的重要路径,但许多经RL微调的模型出现‘越训越单一’问题。复旦大学等团队聚焦长期被忽视的KL散度项,提出DPH - RL方法,可缓解多样性坍塌。

新智元
算法论文8

CVPR 2026|1分钟单图变4D视频!AI看图直接脑补物理规律

北京理工大学和理想汽车等团队提出全新框架PhysGM,引入DPO实现端到端快速前馈推理,能1分钟内将单图生成为4D动态视频,在速度和评价指标上超越主流模型,相关工作被CVPR 2026接收且代码已开源。

机器之心
算法论文8

CVPR 2026 | ReFTA:打破张量化PEFT的「权重重建」瓶颈

随着大模型发展,全参数微调成本高,参数高效微调(PEFT)成主流。常见基于矩阵秩分解的PEFT方法有局限,张量化PEFT虽有优势但存在权重重建问题。本文提出ReFTA方法解决该问题,有工程和理论优势。

机器之心
算法论文8

北大团队提出 SHINE:将任意文本转化为大模型 LoRA,仅需一次前向传播!

北大团队提出全新超网络架构 SHINE,仅需一次前向传播就能将任意文本转化为大模型 LoRA 参数,支持多轮对话。该方法实用潜力大、架构创新高效,训练流程成熟,推理快速,为大模型持续学习提供新思路。

机器之心