「参数量估算」共找到 1255 篇相关文章
AAAI 2026结果公布,刷出88887高分!2.3万投稿录用率仅17.6%
AAAI 2026录用结果公布,投稿量达23,680篇创历史新高,录用率仅17.6%。多位研究员论文被录用,如北大顾怿洋、南洋理工加小俊等。同时,Reddit上对此次录用讨论热烈,有人质疑存在‘关系户’现象。
半年赚2亿,400亿市值,它是又一个“寒武纪”?
高端光芯片长期被海外垄断,源杰科技在技术隐士张欣刚带领下实现突破。其25G激光器芯片通过验证,后多款芯片量产,2025年上半年业绩与股价双涨,市值超400亿,还布局美国生产基地。
HF日趋榜一!真端到端模型AutoDeco终结手动调参解码
大语言模型手动调参解码繁琐,腾讯AI Lab王琰团队联合港中大(深圳)唐晓莹教授团队推出AutoDeco架构,通过创新训练策略让模型动态预测解码参数,在多模型实验中表现出色且已开源。
量化噪声竟是RL秘钥?QeRL:高效强化学习新范式,一场噪声引发的性能革命
近年来,大语言模型在复杂推理任务中面临挑战,强化学习虽更接近人类推理过程,但训练“烧资源”。论文《QeRL》提出量化不仅能压缩模型、节省资源,还能增强模型探索能力,QeRL框架实现训练速度提升、内存占用减半。
「美队」老黄深夜扔出地表最强GPU!算力百倍狂飙,下次改演雷神
凌晨,老黄GTC主题演讲华盛顿首秀,亮出下一代GPU核弹Vera Rubin,性能狂飙100倍。目前,Blackwell已全面量产,2026年底两大GPU王牌预计爆赚5000亿美金。此外,英伟达还公布了一系列合作与技术创新。
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。
为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本
近年来大模型推理开销增长,MoE架构虽能避免计算量同比增,但带来扩展性差、容错性低、负载不均等问题。为此作者提出全新「专家即服务」推理架构EaaS,实验显示它能锐减37.5%成本。
到底谁是第一,阿里和字节吵了起来
AI行业发展,阿里和字节为谁是AI云第一起争执。源于不同报告定义时间滞后、AI云定义不同。MaaS服务是衡量大模型调用量依据,但难定谁领先,阿里云和火山云将有一场恶仗。
CJA|西工大林海涛、张伟伟等:关联函数学习:适用飞行器外形泛化的稀疏气动数据重构方法
本文提出关联函数学习(SFL)方法,通过符号回归挖掘气动力系数复合函数表达式,实现非线性气动数据稀疏重构与状态外推。用少量样本构建数据库,误差 1%-5%,比 Kriging 法样本量减超 90%。
超越RAG和DAPT!华人团队新研究引热议:即插即用、无需改变原参即可让模型化身领域专家
华人团队提出比DAPT和RAG更方便、成本更低的方法,即“Memory Decoder”预训练记忆模块。它像“领域知识插件”,即插即用、不改原参,能让Qwen、Llama等模型成领域专家,还降低困惑度。