「训练推理协同」共找到 3861 篇相关文章
老外傻眼!明用英文提问,DeepSeek依然坚持中文思考
DeepSeek-V3.2和DeepSeek-V3.2-Speciale推理能力显著提升,海外研究者用英文提问,它却用中文思考。评论有两种观点,相关论文显示中文省token但非最有效,大模型选思考语言并非只看效率。
Nanbeige4.2-3B:探索通用Agent小模型
在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。
传统云还在「卖铁」,下一代云已在「炼钢」:火山引擎xLLM如何一张卡榨出两张的性能!
大模型上线部署时推理成本高、算力投入大但效果不成正比,企业面临推理效率难题。火山引擎 xLLM 大语言模型推理框架性能极致,成本低,集成关键创新,还被集成到 AI 云原生推理套件 ServingKit 中。
DeepSeek 模型技术之旅:从 V3 到 V3.2
本文深入剖析了 DeepSeek 模型从 V3 到 V3.2 的技术演进,对比了基座与推理模型,介绍了架构、训练方法变化,如 V3.2 结合 MLA 与 DSA,更新奖励和 GRPO 算法,还提及 V3.2-Speciale 扩展思考特性。
小模型大作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部大模型
近年来,“参数越大,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部大模型,还提出SSP框架和MGPO算法。
刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!
小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。
阿里云Tair KVCache仿真分析:高精度的计算和缓存模拟设计与实现
阿里云Tair KVCache团队推出Tair - KVCache - HiSim,这是面向分布式多级KVCache管理的高保真LLM推理仿真分析工具。它能在通用CPU上高精度预测性能,支撑计算选型、存储规划和调度协同等决策,还介绍了其架构、组件、验证及性能评估等内容。
老黄杀入OpenClaw战场!最强开源「龙虾」模型直逼Opus 4.6
英伟达推出新一代开源模型Nemotron 3 Super,专为大规模AI智能体打造,有1200亿参数,推理快、吞吐量高,性能直逼Claude Opus 4.6等。它解决了Agent应用的难题,还开源了相关数据和训练方法。此外,英伟达还在打造NemoClaw开源AI智能体平台。
Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型
本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。
通义实验室最新成果WebDancer:开启自主智能Deep Research的新时代
通义实验室推出 WebDancer,解决自主信息检索智能体构建难题。它创新合成训练数据,采用两阶段训练策略应对开放网络训练挑战,在多个基准测试中表现卓越,未来还将拓展能力。