「并行推理」共找到 2212 篇相关文章
田渊栋:连续思维链效率更高,可同时编码多个路径,“叠加态”式并行搜索
AI大牛田渊栋团队利用连续空间“叠加态”让大模型并行推理,提升图可达性等任务表现,为连续思维链提供理论支持。还设计注意力选择器等机制,实验显示连续思维链模型准确率更高。此外,田渊栋还是科幻小说家。
上海AI Lab发布混合扩散语言模型SDAR:首个突破6600 tgs的开源扩散语言模型
上海人工智能实验室提出全新范式SDAR,通过‘训练 - 推理解耦’融合AR模型高性能与扩散模型并行推理优势。实验证明,SDAR性能与原版AR模型持平或超越,还能加速推理,且已全面开源全系列模型。
SGLang 推理引擎的技术要点与部署实践|AICon 北京站前瞻
SGLang 是开源推理引擎,截至 2025 年 6 月,在 GitHub 获近 15K Stars,月均下载超 10 万次,被多家行业巨头采纳。InfoQ 专访其核心开发者尹良升,他分享技术、挑战等,6 月 27 - 28 日他将在 AICon 演讲。
马斯克挖不动的清华学霸,一年造出 “反内卷 AI”!0.027B 参数硬刚思维链模型,推理完爆 o3-mini-high
新加坡 Sapient Intelligence 推出小型模型 HRM,参数仅 2700 万却能解决复杂推理难题,其不依赖“思维链”,借鉴人类大脑工作方式。该模型准确率超先进思维链模型,推理能力强,具经济性,可提升任务效率。
DeepSeek倒逼vLLM升级!芯片内卷、MoE横扫千模,vLLM核心维护者独家回应:如何凭PyTorch坐稳推理“铁王座”
本文介绍了vLLM的发展,自开源后成科技公司首选推理引擎。因DeepSeek发布,团队转向其模型特性优化;还参与各芯片支持工作。vLLM靠PyTorch支持多硬件,同时拓展到多模态推理,面临竞争仍保持优势。
我用 AI 翻译的三个阶段:提示词时代 → 推理模型时代 → Agent 时代
作者分享近 2 年 AI 翻译经验,将其分为提示词、推理模型、Agent 三个时代,介绍 Agent 翻译与提示词翻译区别,还阐述 Skill 创建迭代、三种翻译模式由来等,给出解决一致性问题等方法。
多模态扩散模型开始爆发,这次是高速可控还能学习推理的LaViDa
近期基于扩散模型的视觉 - 语言模型 LaViDa 出现,它继承扩散语言模型优点。与自回归模型不同,扩散模型能并行、处理双向上下文。LaViDa 在多任务测试有竞争力,推理蒸馏和文本填空表现好,还能权衡速度与质量。
打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26
现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。
AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠
合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过多层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。
8B模型可以超过GPT-4o!并行KV Cache压缩支持的128K长度外推方法ParallelComp
大模型长文本推理存在瓶颈,作者提出 ParallelComp 方案。它有并行 Attention 分块、KV 缓存智能淘汰与注意力偏差校准三大创新,能让 8B 模型性能达 GPT - 4o 的 91.17%,特定任务超 GPT - 4o。