「推理模型训练」共找到 8394 篇相关文章
英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速
多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。
安全垂类小模型效果能超过大模型?看看以色列Novee的效果
跟踪AI渗透测试等开源应用发现,通用大模型成本高、功能受限。以色列Novee融资5150万美元并发布4B小模型,测试效果超Claude 4 Sonnet。其靠两阶段训练和浏览器反馈提升能力,有投资说明有价值。
Meta 新成立超级智能实验室,让大模型RAG推理速度飙升30倍
Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在多任务测试中表现出色,为大模型部署提供实用方案。
警惕!大模型成本倒挂:你正在为模型的多余「思考」买单
一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。
马斯克开源新模型:能实时抓取社交平台数据,20万块H100训练
马斯克旗下xAI开源去年最佳模型Grok - 2.5,6个月内还将开源旗舰模型Grok 3。Grok - 2.5可实时抓取社交平台X数据,用超20万块H100训练,性能超GPT - 4o等,应用场景广泛。
NeurIPS 25 | GRPO进阶版来了,GVPO重构大模型后训练范式
大模型后训练越发关键,GRPO 有缺陷。作业帮与香港科技大学(广州)团队在 NeurIPS 2025 提出 GVPO 方法,解决 GRPO 稳定性难题,理论有最优解保证,实验表现超现有方法。
反转!LeCun刚转发「全球最快开源推理模型」,ETH苏黎世就直接打假
上周,MBZUAI与G42等开源号称「全球最快的开源AI推理模型」K2 - Think,引发广泛关注,图灵奖得主Yann LeCun也转发相关推文。但三天后,ETH苏黎世研究员发文指出该模型存在数据污染、评估方式不合理等问题。
数据邪修大法好:仅用文本数据就能预训练多模态大模型
多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。
马斯克发布 Grok 4 模型:推理能力较前代提升 10 倍,各学科测试接近满分
xAI 发布 Grok 4 及 Grok 4 Heavy 模型,推理能力较前代提升 10 倍,多测试接近满分。马斯克称其为世界最好 AI。它在多方面表现出色,如长任务能力强、推理效率佳等,但代码能力欠佳,且付费昂贵。后续还将推多款模型。
大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制
大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。