「推理优化与部署」共找到 3516 篇相关文章
阶跃新模型快到“没推理”!印奇上任,果然气势一新
印奇上任后,阶跃星辰发布新一代开源Agent基座模型Step 3.5 Flash,总参数196B,支持256K上下文窗口。它推理快,适配多家芯片厂商,在多场景表现出色,还具备端云协同能力,架构也有多项优化。
最强DeepResearch!通义DeepResearch-30B开源实战:模型部署+LangGraph+A2A全攻略
阿里发布全开源项目通义DeepResearch,在研究任务评测中表现出色,底层是30B的MoE专用推理模型,资源需求低。文章演示了基于该项目构建本地化端到端DeepResearch助理的方法,包括模型部署、Agent实现等。
最受欢迎的开源大模型推理框架 vLLM、SGLang 是如何炼成的?
文章介绍了开源推理引擎 vLLM 和 SGLang,包括起源、创新、社区发展、版本迭代等。vLLM 借鉴分页缓存管理技术,SGLang 基于 RadixAttention 优化。二者竞争激烈,性能趋同,还获投资与基金会关注,受科技公司青睐。
HumanSense:探索多模态推理边界,打造「察言观色会共情」的全模态交互伙伴
蚂蚁集团与西安交通大学联合提出并开源 HumanSense,含评估基准与推理模型。通过细粒度评测、全模态消融等研究,提出优化策略,项目已在 GitHub 和 HuggingFace 开源,推动 AI 交互体验革新。
Meta 新成立超级智能实验室,让大模型RAG推理速度飙升30倍
Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在多任务测试中表现出色,为大模型部署提供实用方案。
英伟达全新开源模型:三倍吞吐、单卡可跑,还拿下推理SOTA
英伟达推出专为复杂推理和agnet任务打造的开源模型Llama Nemotron Super v1.5,实现SOTA表现,吞吐量提至前代3倍,可单卡高效运行。它采用NAS优化架构,经多数据集训练,现已开源。
最新W4A4KV4全量化框架,单卡A100大模型推理速度飙升
计算所王颖研究员团队等联合在ASPLOS 2025上发表并开源COMET框架,通过系统 - 算法协同优化,实现全4比特推理性能突破,在多方面有技术亮点,实测性能碾压现有方案且已开源。
首个实时端侧部署世界模型,20万小时人类视频,BeingBeyond实现「两级跃迁」
4月14日,BeingBeyond发布具身世界模型Being - H0.7,将人类视频规模扩至20万小时,采用隐式推理范式,6项权威评测综合第一。还率先实现端侧实时部署,打通数据闭环,推动模型通用与专家能力跃迁。
AI大模型开发核心技术栈:从框架到部署的全景解析
本文为开发者提供2025年AI大模型开发核心技术栈图谱,解析四大核心支柱技术。基础开发框架含深度学习与AI Agent框架;模型训练与微调有分布式训练、参数高效微调;推理优化含关键技术与主流框架;AI编程辅助工具分主流形态且有发展趋势。
先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?
多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。