并行协同推理」共找到 2542 篇相关文章

新闻资讯8

OpenAI曝出第一颗芯片叫「辣椒」!AI自己设计,9个月流片

OpenAI首颗自研芯片Jalapeño问世,9个月从白纸到流片,创行业最快纪录。该芯片专为大模型推理设计,由其AI参与设计优化,有望降低推理成本,提升用户体验。OpenAI欲做全栈AI公司。

新智元
推荐文章7

【博客转载】CUDA Cooperative Groups

文章介绍CUDA cooperative groups,它让开发者创建和管理能同步通信的线程组,为GPU并行算法编程提供更灵活高效方式。文中讨论并行归约算法及用cooperative groups的实现,还对比不同归约求和方法及性能。

GiantPandaLLM
推荐文章7

评论送书 | 一文读懂多Agent系统演进趋势

文章指出多Agent系统成大模型应用重要方向。分析大模型交互的上下文瓶颈,如语义膨胀、信息密度不均等;阐述Agent间协同结构演化,包括松耦合编排、语义协同等;还说明传统Prompt工程局限及通信与上下文协议的作用。

AIGC开放社区
开源动态8

The Batch: 859 | Qwen3 的自主智能新进展

不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。

DeeplearningAI
开源动态8

Transformer 中的专家混合模型 (MoE)

文章介绍Transformer中专家混合模型(MoE),它能解决稠密模型扩展瓶颈。阐述其优势,如计算高效、适合并行等,还介绍在transformers库中支持稀疏架构的演进,包括权重加载重构、专家执行后端、专家并行及训练方案。

Hugging Face
算法论文8

突破视觉-语言-动作模型的瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知

视觉 - 语言 - 动作模型(VLA)在机器人操控领域潜力大,但应对长时序或精细操作任务时性能下降,根源是缺乏三维空间感知与推理能力。中国科学院自动化研究所与灵宝 CASBOT 提出 QDepth - VLA 模型,提升了机器人空间推理与操控精度。

机器之心
推荐文章8

面向多工具任务调度的两种路径:MCP vs Agent + Function call

本文围绕大语言模型智能应用中的工具与数据接入问题,介绍了基于 Agent + Function Call 的动态调度机制与基于 MCP 的标准化接入框架,分析了不同场景下的适用性,还探讨了二者未来的协同融合方向。

阿里云开发者
开源动态7

The Batch: 948 | GLM 5.1:面向长时任务的能力提升

Z.ai将旗舰开源权重大语言模型升级为GLM - 5.1,可在单个任务自主运行八小时。它专为编程和智能体任务设计,有推理等特性,在多榜单表现佳,但推理和数学能力落后闭源模型,价格有提升。

DeeplearningAI
算法论文8

Reasoning的最终答案可能不是模型想要的答案!

大型语言模型解决复杂问题有推理过程和答案,传统评估只看最终答案。论文提出最终答案可能不佳,中间步骤更值得研究。还介绍通过切割推理过程发现中间步骤藏玄机,提出‘分步检查法’提升模型表现,实验表明准确率最高提升13%等。

深度学习自然语言处理
算法论文8

腾讯发布SpecExit算法,无损压缩端到端加速2.5倍!解决大模型长思考效率难题

腾讯发布 SpecExit 算法,将思考早停与投机采样融合,利用轻量级草稿模型预测“退出信号”,在不引入额外探测开销的前提下,实现动态、可靠的思考早停,在 vLLM 上推理端到端加速 2.5 倍,准确性和推理效率得到双重保障。

机器之心