「推理部署」共找到 2646 篇相关文章
杀疯了!单卡4090跑通全量微调,面壁1B级多模态性能怪兽硬刚大厂
面壁智能推出MiniCPM-V 4.6,参数约1B,性能和推理效率出色。它在多模态任务综合能力、推理速度上领先竞品,靠ViT架构改造和4倍/16倍混合视觉Token压缩实现创新,有工业验证,对开发者和普通用户意义大。
社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。
第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力
新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型。
究竟会花落谁家?DeepSeek最新大模型瞄准了下一代国产AI芯片
近期,DeepSeek发布V3.1新模型,采用全新混合推理架构,在多任务表现上有提升。它采用UE8M0 FP8,或为国产推理芯片优化机制。国内多家厂商新一代AI芯片支持FP8,未来国产大模型或针对其专门优化。
重磅!华为开源业界首个Serverless分布式计算引擎openYuanrong,单机体验编程、极致分布式运行性能
近期,华为开源自研的 Serverless 分布式计算引擎 openYuanrong,它是业界首个统一支持通算和智算场景的开源引擎。能解决传统 Serverless 产品通用性不足等问题,已在华为多个核心产品应用,提升了开发效率和资源利用率。
刚刚,DeepMind开源全栈「Deep Research」项目,AI 研究将人人可用
谷歌DeepMind团队开源基于Gemini 2.5的全栈「Deep Research」项目,能让每个人拥有智能研究助手。它可动态搜索、反思结果,以流式传输提供带引用答案,前后端结合,还介绍了特性、原理、技术栈等。
Linux 基金会推出 Akrites 项目,防护核心开源软件免受 AI 网络威胁侵害
Linux 基金会发起 Akrites 项目,获超 20 家机构支持,旨在保护关键开源软件免受 AI 网络威胁。它建立协调框架,改进漏洞处理方式,补充现有工作,反映网络安全理念转变。
告别玄学选LLM!弗吉尼亚理工选型框架入选ICML 2025
弗吉尼亚理工大学研究人员推出选型框架LensLLM,可预测微调后性能走势,解释大模型微调“玄学现象”。它基于全新PAC - Bayes泛化界限推导,降低成本近90%,被ICML 2025收录。
PaperDebugger:开源的学术版Cursor
PaperDebugger是AI驱动的学术写作助手,能调试和改进论文,提供智能建议。它用基于MCP的编排引擎,模拟学术流程,有聊天、插入、评论等功能,只读取项目,保障隐私。
腾讯发布WeKnora知识库,无缝链接微信生态
微信团队推出基于大模型的文档理解检索框架WeKnora,应用于复杂异构文档场景。它采用多模态预处理等设计,有文档解析、意图识别等特点,可本地私有化,还能与微信生态无缝衔接。