3B参数模型」共找到 8495 篇相关文章

开源动态8

Jina-VLM:可在笔记本上跑的多语言视觉小模型

Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。

Jina AI
算法论文8

刚刚,DeepSeek首曝V3降成本秘诀!软硬协同突破Scaling天花板

DeepSeek最新论文从硬件架构和模型设计双重视角,探讨如何相互配合实现低成本大规模训练和推理,分析硬件特性对架构选择的影响,研究两者相互依赖关系,还为未来协同设计提出建议。

新智元
推荐文章7

The Batch: 894 | 面向生物医学的多模态模型

过去几年联合推理模型进展快,但生物医学领域能力碎片化、脆弱或难解释。2026 年,学术界应推进多模态模型建设,关注深度整合、可解释性、数据效率和适应性及模型在工作流中的整合。

DeeplearningAI
算法论文8

极简RL新范式:一半算力刷新1.5B模型推理SOTA

过去为提升中小参数模型推理能力,开发者构建复杂RL流水线。JustRL论文提出极简、单阶段、固定超参训练方案,在两主流1.5B模型上刷新SOTA,节省2倍算力,消融实验还揭示部分技巧会致性能退化。

深度学习自然语言处理
开源动态8

Apple | 开源视觉语言模型:FastVLM,可手机运行,首token速度提升 85 倍

苹果开源能在 iPhone 上运行的视觉语言模型 FastVLM,代码仓库含 iOS/macOS 演示应用。它解决体积和速度问题,首 token 输出速度提升 85 倍,引入 FastViTHD 编码器,适配 iOS/Mac 生态,有不同参数量级版本。

AINLPer
开源动态8

谷歌版小钢炮开源!0.27B大模型,4个注意力头,专为终端而生

谷歌开源Gemma 3 270M,几分钟就能完成微调,性能超Qwen 2.5同级模型。此模型小巧高效,可本地运行,还能用它构建OCR应用。它有多项亮点,适合多场景,上手简单。

量子位
产品应用8

拜拜Claude!阿里最强万亿模型编程秒了Opus4,实测在此

阿里推出总参数达1万亿的Qwen3 - Max - Preview (Instruct),比前一代Qwen3(235B)强四倍,发布即上线。官方测评显示它打败Claude Opus 4等对手,实测其编程能力出色,后续正式版值得期待。

量子位
产品应用7

苹果推出 Ferret-UI Lite:一款用于查看和控制 UI 的端侧 AI 模型

苹果推出 30 亿参数的 Ferret-UI Lite 端侧 AI 模型,可解析屏幕图像、与应用交互。现有 GUI 智能体方法存在建模复杂等问题,Ferret-UI Lite 性能有竞争力,训练采用两阶段流程,还给出应用建议。

InfoQ
算法论文8

LLM进入「拖拽时代」!只靠Prompt,几秒定制一个大模型,效率飙升12000倍

新智元报道,NUS、UT Austin等机构研究人员提出「拖拽式大语言模型」(DnD),它基于提示词生成模型参数,无需微调适应任务,效率最高提升12000倍,零样本泛化能力出色。

新智元
推荐文章8

多模态大语言模型的核心技术架构与训练方法的进化

文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。

AIGC开放社区