大模型推理」共找到 9454 篇相关文章

推荐文章8

大模型推理加速全链路:内存管理、编译优化、量化与并行策略

本文整理自金煜阳博士在QCon会分享。介绍大模型推理挑战,如规模增、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。

InfoQ
产品应用8

腾讯混元AI Infra如何优化Hy3 Preview:一次大模型推理性能提升的技术拆解

文章聚焦腾讯混元AI Infra对Hy3 preview模型推理性能优化。从算子优化与融合、并行策略等五维度,剖析技术思路、算法及收益,如Attention算子单batch长文本最高加速2.95x,还提及后续显存优化等工作。

腾讯技术工程
算法论文8

Tool-Star:赋予模型结合多工具推理的能力

文章提出Tool - Star框架,旨在解决模型多工具协作推理难题。它从数据端到训练流程优化,让模型调用多种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来多模态及多工具扩展方向。

PaperAgent
开源动态8

4B小模型数学推理首超Claude 4,700步RL训练逼近235B性能 | 港&字节Seed&复旦

香港学NLP团队联合字节跳动Seed、复旦学发布Polaris强化学习训练配方,让4B模型数学推理能力超商业模型,且Polaris-4B可在消费级显卡部署,相关内容已全部开源。

量子位
算法论文8

模型如何准确读懂图表?微软亚研院教它“看、动手、推理

多模态模型处理结构化图像有误差放推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。

量子位
算法论文8

模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮

北邮研究团队通过思维链审计实验,揭示模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。

量子位
算法论文8

拒绝“熵崩塌”和“熵爆炸”!这项研究让模型学会“精确探索”,推理成绩飙升

2024年以来,模型推理任务上进展显著,得益于RLVR方法,但面临“熵困境”。研究团队提出选择性熵正则化方法(SIREN),通过三重机制精准调控探索行为,实验证明其能提升模型推理成绩。

量子位
算法论文8

从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现模型高效沉默推理

复旦学等机构团队论文提出SIM - CoT技术,解决隐式思维链推理准确率低、不稳定问题。该技术引入步骤级监督,提升性能、效率和可解释性,在多模型和任务测试中表现出色,让模型高效沉默推理

AIGC开放社区
算法论文7

多模态模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合

清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估模型视觉推理能力。结果显示,主流模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出模型在复杂多模态推理任务中能力不足。

量子位
开源动态8

32B 稠密模型推理能力超越 R1?中国秘密 AI 团队发布推理模型 AM-Thinking-v1

2025年,国内神秘A - M - team在Hugging Face开源32B推理模型AM - Thinking - v1。它在多推理评测中击败DeepSeek - R1,与超规模模型成绩相当。团队靠后训练方案挖掘32B模型潜力,探索小体量实现能力路径。

AI科技评论