训练 - 推理不匹配」共找到 3626 篇相关文章

算法论文8

小模型大作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部大模型

近年来,“参数越大,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部大模型,还提出SSP框架和MGPO算法。

深度学习自然语言处理
开源动态8

刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!

小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。

新智元
开源动态8

老黄杀入OpenClaw战场!最强开源「龙虾」模型直逼Opus 4.6

英伟达推出新一代开源模型Nemotron 3 Super,专为大规模AI智能体打造,有1200亿参数,推理快、吞吐量高,性能直逼Claude Opus 4.6等。它解决了Agent应用的难题,还开源了相关数据和训练方法。此外,英伟达还在打造NemoClaw开源AI智能体平台。

新智元
开源动态8

Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型

本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。

Jina AI
算法论文8

通义实验室最新成果WebDancer:开启自主智能Deep Research的新时代

通义实验室推出 WebDancer,解决自主信息检索智能体构建难题。它创新合成训练数据,采用两阶段训练策略应对开放网络训练挑战,在多个基准测试中表现卓越,未来还将拓展能力。

机器之心
开源动态8

字节清华智能体自动写CUDA内核,比torch.compile加速2.11倍

字节Seed与清华AIR团队开源CUDA Agent,在GPU内核优化基准KernelBench上成绩优异。它是大规模智能体强化学习系统,训练数据经多阶段构建,分阶段训练,全面超越商业模型,还开源了训练数据集。

量子位
算法论文8

AAAI 2026 Oral | 拒绝「一刀切」!AdaMCoT:让大模型学会「看题下菜碟」,动态选择最佳思考语言

多语言大模型面临语言选择难题,现有跨语言推理方法存在缺陷。新加坡研究团队推出AdaMCoT框架,通过自适应路由机制动态选语言推理,提升跨语言事实推理准确性与一致性,效果超越传统方法。

机器之心
开源动态7

在 Cache-DiT 框架下实现原生 Serving功能

Cache-DiT 是唯品会开源的 PyTorch 原生 DiT 推理加速引擎,此前聚焦离线推理。现实现完整 Serving 功能,支持单卡与分布式推理模式。文章介绍其实现过程、借鉴 SGLang 的设计,还总结踩坑及使用方法。

GiantPandaLLM
算法论文8

ICML 2025|如何凭「自动补全」实现100K生成3×加速?

在大模型推理复杂的当下,生成超长文本成本高。BIGAI NLCo团队提出推理加速框架TokenSwift,被ICML 2025接收。它重构传统自回归推理,解决长生成瓶颈,在多模型实验中表现亮眼。

机器之心
产品应用7

Cursor Composer 2.5 拆解:最强大的 RL 环境,就是你自己的产品

今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强大的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。

Founder Park