「小模型推理能力」共找到 9209 篇相关文章
Mamba核心作者新作:取代DeepSeek在用的注意力机制,专为推理打造
Mamba核心作者Tri Dao团队提出GTA和GLA两种专为推理定制的注意力机制,在减少KV缓存用量、保持模型质量的同时,显著提升解码速度,优化长上下文推理能力。
推理速度飙升5倍,苹果提出全新Multi-Token生成框架!
自回归语言模型逐词生成文本拖慢推理速度、限制并行能力。Apple提出全新框架,挖掘其对未来词元“先验知识”,通过多项技术并行预测多词元,微调预训练模型可显著提速且不损输出质量。
商汤科技与南洋理工大开源空间智能多模态SOTA模型
商汤科技与南洋理工大学构建800万量级三维空间数据集,训练出开源SOTA多模态基础模型SenseNova - SI系列。该系列模型在多个权威测试中表现出色,部分超越GPT - 5,还展现出泛化等能力,且能赋能具身智能。
奥特曼深夜官宣:OpenAI重回开源!两大推理模型追平o4-mini,号称世界最强
OpenAI深夜推出gpt-oss 20B和120B两款开源模型,性能比肩o3-mini和o4-mini,能在消费级显卡甚至手机运行。有宽松许可证等亮点,还准备了体验网站。这是自GPT - 2后首次开源,降低了部分群体准入门槛。
ChatGPT默认模型大升级,GPT-5.5 Instant正式上线:新增记忆来源功能
OpenAI宣布ChatGPT默认模型升级为GPT-5.5 Instant,面向所有用户开放。升级核心是准确性,在高风险领域幻觉内容减少,能力全面提升,回复更简洁。还提升了个性化能力,引入记忆来源功能。
DeepSeek 模型技术之旅:从 V3 到 V3.2
本文深入剖析了 DeepSeek 模型从 V3 到 V3.2 的技术演进,对比了基座与推理模型,介绍了架构、训练方法变化,如 V3.2 结合 MLA 与 DSA,更新奖励和 GRPO 算法,还提及 V3.2-Speciale 扩展思考特性。
链式思维是幻象吗?从数据分布视角重新审视大模型推理,马斯克回复,Grok破防
亚利桑那州立大学研究发现,思维链(CoT)推理可能只是对训练数据分布内模式的复现,输入与训练数据分布有差异时,推理链条会失效。研究探究了CoT泛化性等问题,对实际应用提出警示。
大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练
字节Seed和北大研究团队提出In - Place TTT方案,让大模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。
狂拿大模型明星订单,一家清华系HPC-AI Infra公司浮出水面
本文介绍清华系计算创业公司是石科技,其93年创始人闫博文不囤算力仍拿下大模型明星公司订单。团队技术实力强,3次获戈登·贝尔奖。公司构建全栈能力,为多领域提供服务,未来想以算力赋能各行业。
AAAI 2026|视频大语言模型到底可不可信?23款主流模型全面测评来了
合肥工业大学与清华大学团队推出视频大语言模型综合可信度评测基准 Trust-videoLLMs,对 23 款模型从五维度 30 项任务评测,揭示性能格局,指出模型现存问题,还开源评测框架等。