训练推理效率」共找到 4341 篇相关文章

算法论文8

ICML 2026 | 将多教师冲突转化为动态约束,破解多模态大模型推理对齐难题

在多模态大模型发展中,多教师知识蒸馏成提升性能关键,但教师模型存在“概念漂移”问题。悉尼科技大学团队提出 APO 框架,将模型间“漂移”转化为动态负约束,解决多模态大模型多师蒸馏概念对齐难题,工作被 ICML 2026 接收。

机器之心
新闻资讯8

科学家要失业了?GPT-5仅用18分钟解出黑洞方程,效率碾压人类数月!

2026年AI成科学家新战友,从破解优化难题到重现黑洞对称性,加速科学发现。数学家与ChatGPT合作完成证明,物理学者用GPT-5 Pro快速解黑洞方程,OpenAI还助力攻克生物学难题。

新智元
算法论文8

省下1.25倍算力!Kimi这篇论文,可能改写所有大模型的训练方式

大模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。

AI寒武纪
新闻资讯8

【AAAI 2026大会特邀报告】从推理到科学发现:AI迈向可精专通才之路

上海人工智能实验室周伯文在AAAI 2026大会提出,当前处于AGI前夕,需通专融合智能。他认为可深度专业化通用模型是实现AGI的可行路径,科学发现是AI前沿,还介绍了SAGE架构及相关成果。

OpenMMLab
算法论文8

梁文锋署名!DeepSeek再发炸裂论文:提出“条件记忆”新范式,彻底打破GPU推理显存墙

来自DeepSeek的新论文提出“条件记忆(Conditional Memory)”新范式,推出Engram模块,实现可扩展知识查找。研究揭示U形缩放定律,构建的Engram模型性能超越纯MoE基线,还打破了GPU显存瓶颈。

AI寒武纪
新闻资讯7

Meta详细阐述基于LLM级训练、混合并行计算与知识迁移的GEM广告模型

Meta发布生成式广告模型GEM详细信息,旨在改善平台广告推荐能力。它处理海量用户 - 广告交互数据,用三种方法构建系统,还实施GPU级优化,采用两种知识迁移策略,获业内人士认可。

AI前线
算法论文8

图片生成仿真!这个AI让3D资产「开箱即用」,直接赋能机器人训练

南洋理工大学与上海人工智能实验室团队提出PhysX - Anything,首个面向仿真、具物理属性的3D生成框架。它仅需单张图像就能生成可用于仿真的3D资产,在多项测试中表现优异,有望推动3D重建范式转变。

量子位
开源动态8

华为开源突破性技术Flex:ai,AI算力效率直升30%,GPU、NPU一起用

11月21日,华为发布AI容器技术Flex:ai并联合高校将其开源。该技术基于Kubernetes构建,有三大核心突破,能提升算力利用率,异构兼容性优于Run:ai,将推动国产算力应用。

机器之心
新闻资讯7

90%打工人「自费买AI上班」,开启To P革命!每月花20刀效率翻倍

面对AI淘汰焦虑,大量职场人主动自费买AI工具,开启「自我拯救」运动,催生出To P新赛道。文章分析其发展快的原因,也提及To B和To C赛道后续发展的条件。

新智元
开源动态8

科学能力太强,这个多模态推理「六边形战士」被严重低估!Intern-S1开源登顶

7月26日,上海AI实验室发布并开源「书生」科学多模态大模型Intern-S1,其多模态能力全球开源第一,文本能力比肩一流,科学能力国际领先。它开创「通专融合」新范式,重构科研生产力,引发国际关注。

新智元