「多模型推理」共找到 9928 篇相关文章
英伟达叫板DeepSeek?怒投260亿美元,要打造最强开源模型
英伟达已成为人工智能时代基础设施的一部分,2023年11月推出首个Nemotron模型进入通用大模型领域。未来五年将投260亿美元构建开源模型,还发布了性能最强的开源模型Nemotron 3 Super。
刚刚!Thinking Machines Lab | 长文揭开LLM推理不确定性真相!
Thinking Machines Lab发布《克服LLM推理中的不确定性》,揭示大语言模型推理不确定性原因,并非“并发 + 浮点”假设那么简单,主要是负载及batch size不确定所致,还给出让核函数有批次不变性的方法及实验结果。
AI Infra 工程师们如何应对大模型流水线里的“暗涌”?
InfoQ《极客有约》X AICon 直播邀请华为、蚂蚁集团等专家探讨大模型 Infra 工程师实战日常。涉及大模型工程高频问题、版本迭代冲突处理、推理部署成本优化、开源项目挑战及 GPU 虚拟化趋势等内容。
1.5万人收藏!这款 NotebookLM 开源平替太还原了,模型随意切换!
Google的NotebookLM虽火,但有国内使用难、数据不私密、模型单一等痛点。Open - Notebook是其开源平替,完全本地可部署,功能超全,支持多模型,近半月GitHub星标增10K,总收藏1.5万。
KDD 2025 Best Paper Runner-Up | EI-BERT:超紧凑语言模型压缩框架
香港城市大学王茂林等提出 EI - BERT 框架,解决移动设备部署 NLU 模型难题。通过硬令牌剪枝、交叉蒸馏、模块化量化,实现 99.5% 压缩率。在多任务中表现出色,已在支付宝大规模应用。
AI Infra 工程师们如何应对大模型流水线里的“暗涌”?
InfoQ《极客有约》X AICon 直播,邀请华为昇腾专家 ZOMI 酱、蚂蚁集团马介悦和 SGLang 尹良升探讨大模型 Infra 工程师实战日常。涉及大模型工程高频问题、版本迭代策略、推理部署优化、开源项目挑战等内容。
全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%
斯坦福和MIT团队推出新AI智能体推理框架ReCAP,在长上下文任务中全面超越ReAct,性能提升显著。它通过独特结构和三大机制解决大模型常见问题,虽成本增加,但在关键任务表现出色,潜力巨大。
AGI前夜重磅:RL突破模型「认知上限」,真·学习发生了!
AI研究圈争论RL能否赋予模型超越基础模型的推理能力。UC Berkeley等团队提出DELTA框架,观察到“RL grokking”现象,还设计新任务验证,提出两阶段奖励调度,总结两种模式等,为争论带来新依据。
推理速度飙升5倍,苹果提出全新Multi-Token生成框架!
自回归语言模型逐词生成文本拖慢推理速度、限制并行能力。Apple提出全新框架,挖掘其对未来词元“先验知识”,通过多项技术并行预测多词元,微调预训练模型可显著提速且不损输出质量。
英伟达龙虾模型开源,12B激活登上成功率全球第四
英伟达发布专为龙虾打造的开源模型Nemotron 3 Super,总参数120B,激活参数12B,在龙虾模型基准PinchBench上成功率全球第四。该模型结合Mamba与Transformer架构,引入多项创新技术,还开源了模型权重、数据集等。