「推理可解释性」共找到 5609 篇相关文章
微软:DeepSeek-R1等推理模型循环的原因找到了
前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型在低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。
Transformer危!谷歌MoR架构发布:内存减半推理速度还翻倍
谷歌推出全新底层架构Mixture-of-Recursions(MoR),推理速度提高2倍、KV内存减半,首次在单一框架实现多任务处理与动态分配计算资源,研究人员通过实验验证其性能超Transformer。
1.4亿宝可梦玩家,都在给AI免费打工…
1.4亿《精灵宝可梦Go》玩家10年拍300亿张实景图,为Niantic免费收集数据。Niantic用此数据训练VPS视觉定位系统,提升机器人配送效率,还获巨额投资,剥离游戏业务专注空间AI。
蚂蚁开源 Ring-1T,成就推理、编程、通用智能三冠王
蚂蚁开源团队推出 Ring-1T 模型,它结合强化学习与多阶段推理机制,实现从‘模仿’到‘思考’的转变。该模型在多基准测试表现优异,其高性能得益于 IcePop、C3PO++、ASystem 三项关键技术。
快手提出强化学习创新框架RLEP,突破大模型推理瓶颈
OpenAI等模型用强化学习提升推理能力,但面临训练不稳定等挑战。快手Klear团队提出RLEP框架,引入经验回放技术,分经验收集和回放训练两阶段,还采用优化策略,提升大模型训练效率和性能。
DeepSeek秘密造芯!专攻推理,一年前已启动,招聘全程不公开
路透社消息,凭借算法震动硅谷的中国AI公司DeepSeek正秘密开发自研AI芯片,定位推理,项目约一年前启动,现处早期。全球模型公司自研芯片成趋势,虽挑战大,但DeepSeek有资金支撑。
DeepSeek推理再提速80%,V4正式版定档7月中旬
DeepSeek两天前开源DSpark推理加速框架,已在V4预览版在线服务跑真实流量,使生成速度提升60% - 85%。DSpark化解推测解码问题,在多模型超Eagle3和DFlash。V4正式版7月中旬上线,将引入峰谷定价。
无VAE扩散模型! 清华&可灵团队「撞车」谢赛宁团队「RAE」
清华大学智能视觉团队和快手可灵团队联合推出《Latent Diffusion Model without Variational Autoencoder》,提出 SVG 框架,用预训练视觉特征编码器替代传统 VAE,解决了传统「VAE + Diffusion」范式的效率与通用性痛点。
华为+DeepSeek,推理性能创新高!技术报告也公布出来了
华为昇腾在部署超大规模MoE时推理性能创新高,全面超越英伟达Hopper架构。其采用‘以数学补物理’方式,还将全面开源。团队从多方面优化,在不同硬件上取得优异性能,本周还将举办技术披露周。
Mini-Omni-Reasoner:实时推理,定义下一代端到端对话模型
现有端到端对话模型推理能力未解锁,因深度思考带来延迟。为此提出 Mini - Omni - Reasoner,采用边思考边表达范式,突破‘要么快,要么准’困境,还设计了数据合成管线和五阶段训练方法,实验证明其性能提升明显。