「低成本训练」共找到 3846 篇相关文章
全网最强万字解读:DeepSeek-V4 掀翻了谁的桌子? | GAIR live 030
文章深度解读了DeepSeek-V4,从产业、生态和架构维度拆解其效率账本。它成本低,补齐短板适配昇腾芯片,但极致省钱也有代价,如性能衰减、架构复杂等。还探讨了长上下文、MoE与稠密模型路线差异及商业化潜力。
社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。
Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型
本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。
通义实验室最新成果WebDancer:开启自主智能Deep Research的新时代
通义实验室推出 WebDancer,解决自主信息检索智能体构建难题。它创新合成训练数据,采用两阶段训练策略应对开放网络训练挑战,在多个基准测试中表现卓越,未来还将拓展能力。
字节清华智能体自动写CUDA内核,比torch.compile加速2.11倍
字节Seed与清华AIR团队开源CUDA Agent,在GPU内核优化基准KernelBench上成绩优异。它是大规模智能体强化学习系统,训练数据经多阶段构建,分阶段训练,全面超越商业模型,还开源了训练数据集。
SOP:具身智能在线进化新范式,为大规模真实世界部署而生
智元机器人具身研究中心提出SOP在线后训练系统,将VLA后训练重构为“在线、集群、并行”,可即插即用后训练算法。它有高效探索、缓解偏移等优势,实验显示能提升性能、效率,突破VLA瓶颈。
RAG系统设计:揭秘语义搜索被低估的核心价值与KG驱动的架构选型策略
在AICon大会上,Hugging Face的尹一峰探讨基于语义搜索的RAG系统重要性,揭示其被低估原因,分析本质与作用,分享设计高效架构方法,还讨论KG驱动的RAG系统及范式选择。
开源!强效果,高性能,严隐私?我全都要:OPPO 终端大模型实践
OPPO AI 中心推出开源端侧多模态大模型 AndesVL,含 0.6B - 4B 四档尺寸套件,有通用能力强等优势。它经多阶段训练,OPPO 还构建端侧部署方案,评测显示其在多方面表现优异,未来会继续技术革新。
AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源
快手全新多模态大语言模型Kwai Keye-VL上线且开源,能深度融合多模态信息,在视频理解、复杂视觉感知和逻辑推理上表现优异。介绍了其技术架构、预训练和后训练策略及训练架构优化等内容。
快手在 AI 上,渐入佳境
文章介绍快手多模态大模型 Keye-VL 1.5,参数 8B 适合中小企业。它侧重短视频场景,视频理解能力强,能与业务结合,提升推荐等场景效率。还详述其架构、预训练、后训练及训练架构优化等技术细节。