并行推理加速」共找到 2704 篇相关文章

算法论文8

Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了

Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的多实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。

量子位
开源动态8

Meta最新REFRAG框架引爆RAG圈!KV缓存暴降90%,速度狂飙30×

Meta推出REFRAG框架解决RAG难题。它能在不修改解码器参数下压缩上下文、复用文档向量等。实验显示,它降低KV缓存、加速TTFT,在多任务表现佳,为大模型与知识库结合提供新范式。

CourseAI
产品应用8

OpenAI 发布公司领导者 AI 行动指南,助力企业发展

OpenAI 2024 年走访超 200 家营收 10 亿美元企业,发现拖慢 AI 落地的是‘领导层叙事缺口’。结合客户实践,总结出对齐、激活、放大、加速、治理 5 个可落地步骤,助企业构建以 AI 为核心的组织。

带你学AI
算法论文8

通用LLM压缩算法,居然藏视频编码里!2.5bit实现4bit性能,硬件无缝支持

LLM.265研究发现,视频编码器是高效的大模型张量编码器,现成视频编解码硬件压缩AI模型数据效率高。它灵活控制码率、可压缩多种张量,还能利用GPU硬件加速。实验显示其压缩效果显著。

新智元
新闻资讯7

DiT在数学和形式上是错的?谢赛宁回应:不要在脑子里做科学

X上有博主称DiT存在架构缺陷,其FID过早稳定,可能无法继续从数据中学习。还批判了DiT的设计,如使用后层归一化和adaLN - zero。DiT作者谢赛宁回应,强调做研究要基于实验,也指出DiT现存一些问题。

机器之心
产品应用8

360安全云架构全解,AI智能体如何开启「主驾」新时代?

AI发展加速,网络安全危机加剧。360安全云在ISC.AI 2025大会发布新产品,提出“安全即服务”理念,打造AI驱动的四层架构,发布三大类智能体,为企业提供全生命周期价值交付的安全服务。

甲子光年
算法论文8

研究者警告:强化学习暗藏「策略悬崖」危机,AI对齐的根本性挑战浮现

强化学习是大模型推理与对齐的核心方法,但常带来模型行为脆弱等问题。上海人工智能实验室徐兴成博士论文揭示‘策略悬崖’挑战,分析其成因,解释多种对齐失败现象,并提出对AI研究的启示。

机器之心
开源动态7

梳理SGLang中DP Attention及其Padding问题

作者梳理SGLang中DP Attention及其Padding问题。介绍DP Attention背景、流程,指出padding分max和sum模式,旧版sum padding浪费计算、影响cuda graph使用,v0.4.10后有优化,max padding仍待完善。

GiantPandaLLM
产品应用8

让64张卡像一张卡!浪潮信息发布新一代AI超节点,支持四大国产开源模型同时运行

浪潮信息发布新一代AI超节点“元脑SD200”,可让64张卡像一张卡。它支持四大国产开源模型同时运行,实现算力聚合突破,通过软硬协同优化提升推理性能,采用开放架构推动“智能平权”。

量子位
推荐文章8

长上下文不再难:KV Cache 全生命周期优化实战

长上下文大语言模型发展带来计算和内存挑战,现有基准测试多忽视 KV 缓存完整生命周期。微软姜慧强在 AICon2025 分享 SCBench 工具,梳理推理优化方法,介绍 MInference 等,还提出 Tri - shape 方法等成果。

AI前线