「推理优化与部署」共找到 3516 篇相关文章
OpenAI自研芯片270天光速成功!谷歌TPU大将主导,老黄一夜大客户变对手
OpenAI发布自研推理加速芯片Jalapeño,与博通和Celestica合作打造,专为大模型优化,9个月就流片。操刀者是前谷歌TPU核心成员Richard Ho,计划2026年底部署。此前谷歌、微软等已自研芯片,英伟达客户变对手。
6.1B打平40B Dense模型,蚂蚁开源最新MoE模型Ling-flash-2.0
蚂蚁百灵大模型团队开源 MoE 大模型 Ling-flash-2.0,其以轻量级配置展现卓越性能,在推理速度、任务性能、部署成本间找到新平衡,为大模型‘参数膨胀’提供新路径,还在多领域应用表现出色。
高性能计算群星闪耀时
本文介绍了高性能计算(HPC)在大模型时代的重要性,以及清华高性能计算团队在HPC及相关领域的研究与实践。如郑纬民带领团队突破存储技术,陈文光、翟季冬等助力大模型训练,武永卫团队优化推理,张悠慧探索类脑计算。
SAPO:让强化学习告别“硬剪切”
强化学习是提升大语言模型推理能力的核心技术之一,但现有基于组的策略优化方法面临 token 级重要性比率高方差问题。GRPO 和 GSPO 采用硬剪切有学习信号丢失等缺点。为此提出 SAPO,用平滑门控函数替代硬剪切,实验效果良好。
超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭
近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率低。
Qwen3接连放出No Thinking, Thinking两大模型,Gemini2.5 pro顶不住啦
Qwen推出非推理模型`Qwen3 - 235B - A22B - Instruct - 2507`后,又放出推理模型`Qwen3 - 235B - A22B - Thinking - 2507`。非推理模型在多方面功能增强,推理模型能力强,超DeepseekR1,可试用。
公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族
英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。
AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」
近年大模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊大学厄巴纳 - 香槟分校和加州大学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。
ASO是什么意思?ASO目标与工作内容,ASO常见误区(基础篇)
ASO(应用商店优化)的精髓在于通过对产品特性的分析与用户群体标签的判断,挑选相关度高的关键词,提升App的覆盖、曝光、转化,从而获取更多用户。它不仅包括关键词搜索排名优化,还涉及榜单排名、转化率、推荐位等优化,提升App在应用商店的自然下载量。
ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式
本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。