「小模型推理」共找到 8496 篇相关文章
700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆大模型推理
今年6月Sapient Intelligence提出的HRM影响大模型推理结构,四个月后三星研究员Alexia Jolicoeur - Martineau推出TRM,700万参数模型在推理基准测试中超越参数多10000倍的模型,还介绍了TRM原理、改进及实验结果。
绝对零监督Absolute Zero:类AlphaZero自博弈赋能大模型推理,全新零数据训练范式问世
清华大学 LeapLab 团队等提出全新推理训练范式 Absolute Zero,使大模型实现「自我进化式学习」。基于此范式训练的模型 AZR,在代码生成与数学推理基准任务表现出色,缓解了大模型对人工数据依赖难题。
大模型推理上限再突破:「自适应难易度蒸馏」超越R1蒸馏,长CoT语料质量飞升
本文从中兴通讯无线研究院「大模型深潜」团队切入,介绍了首创的「LLM自适应题目难度蒸馏」方法,该方法围绕「模型 - 数据动态匹配」提出了一条完整的CoT构建流程,显著提升了长CoT语料的质量。
上交大 × 华为小艺推出LoPA:7B扩散语言模型单样例1000+ tokens/s!
上海交通大学DENG Lab联合华为小艺团队提出无需训练的解码算法LoPA,配合自研的LoPA - Dist分布式推理系统,显著提升扩散大语言模型(dLLMs)的推理并行度和吞吐量,将推理效率推向新高度。
港科提出新算法革新大模型推理范式:随机策略估值竟成LLM数学推理「神操作」
香港科技大学联合团队提出 ROVER 算法,跳过传统强化学习推理的策略迭代循环。它在多项数学推理基准上超越现有方法,在高难度任务中大幅提高 pass@1 和 pass@256,且提升推理多样性,更轻量。
Meta提出StepWiser,让模型学会“反思”自己的推理过程
Meta提出StepWiser解决大语言模型推理逻辑正确性问题。它训练生成式评判模型,通过强化学习在线训练,能解释推理步骤好坏。实验显示其远超传统方法,为构建可靠AI系统提供新思路。
Tool-Star:赋予大模型结合多工具推理的能力
文章提出Tool - Star框架,旨在解决大模型多工具协作推理难题。它从数据端到训练流程优化,让模型调用多种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来多模态及多工具扩展方向。
VLA 推理新范式!一致性模型 CEED-VLA 实现四倍加速!
近年来,VLA模型成机器人领域重要研究方向,但推理速度受限。本文提出一致性蒸馏训练、混合标签监督机制及提前退出解码策略,在多基线模型上实现超4倍推理加速,实验验证其高效通用。
大模型能力,小模型成本!Google等 | 提出递归混合框架:MoR, 大幅提升LLM计算效率
Google提出递归混合框架(MoR),融合参数共享与自适应计算。它有轻量级路由和KV缓存策略,在不同路由机制各有优劣。实验显示,MoR在性能、计算和内存效率上表现出色,有望实现“大模型能力,小模型成本”。
小模型大作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部大模型
近年来,“参数越大,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部大模型,还提出SSP框架和MGPO算法。