领域大模型」共找到 9815 篇相关文章

算法论文8

模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!

Qwen团队等最新研究打破传统认知,揭示‘对齐税’现象。提出置信解码策略,在多架构、评测集上表现出色,能绕过‘对齐税’,提升推理准确率,且工程开销低,为模型发展提供新思路。

量子位
开源动态8

社区供稿 | 开源SOTA:阶跃发布端到端语音模型Step-Audio 2 mini!

阶跃星辰发布最强开源端到端语音模型 Step - Audio 2 mini,在多个国际基准测试集获 SOTA 成绩。它统一建模语音理解等,率先支持语音原生 Tool Calling 能力,架构创新,案例展示其多方面强能力。

Hugging Face
算法论文8

省下1.25倍算力!Kimi这篇论文,可能改写所有模型的训练方式

模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。

AI寒武纪
算法论文7

估值840亿AI实验室再放招,他们要给模型戴上「紧箍咒」

新智元报道,OpenAI前CTO创办的Thinking Machines Lab发布研究「模块流形」,将传统数值修正转为「预防式」约束优化。它提出新范式,为训练模型提供新思路,还介绍了流形优化器及相关算法。

新智元
产品应用8

模型提速80%,华为拿出昇腾推理杀手锏FlashComm,三招搞定通算瓶颈

模型推理通算难题凸显的背景下,华为数学家祭出 FlashComm。它包含三项技术,分别在 AllReduce 通信、以存换传、多流并行方面优化,解决通信瓶颈,提升推理性能,未来还将围绕多方向创新。

机器之心
算法论文8

ICML 2026 | 模型为什么算不对加法?南团队提出等本位和轨迹,揭示LLM算术错误的几何机制

团队研究LLM在多操作数加法中的内部表征结构,发现算术状态呈高度结构化几何流形。提出等本位和轨迹与噪声量化模型,解释模型算错加法原因,还设计推理时纠错方法。

机器之心
产品应用8

在WAIC现场,全球首个拥有「原生记忆力」的模型亮相,但不是Transformer

在WAIC上,RockAI推出基于非Transformer架构Yan 2.0 Preview的多模态模型,有原生记忆能力。它在性能指标上优势明显,其记忆机制接近生物方式,团队秉持理念推动离线智能,获硬件厂商关注。

机器之心
推荐文章7

语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?

语言模型在高考数学拿高分靠强化学习,但文科题无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和多模态直接读图等因素。

宝玉AI
推荐文章7

揭秘模型评测:如何用“说明书”式方法实现业务场景下的精准评估

文章系统性介绍业务场景下模型评测流程,包括需求分析、评测集设计生成、维度设定、任务执行和报告输出。指出评测挑战,如设计维度和集,还给出评测方法及案例,像蚂蚁评测集、业务自动化评测。

阿里云开发者
算法论文8

模型到底是怎么「思考」的?第一篇系统性综述SAE的文章来了

语言模型时代,人们需要“能解释”的LLM。SAE技术崛起,作者团队发布首篇SAE综述,梳理其技术、演化和挑战。介绍了SAE概念、优势,涵盖其技术框架、可解释性分析等多方面内容。

机器之心