新学徒制模式」共找到 4351 篇相关文章

产品应用8

昇腾+鲲鹏联手上大招!华为爆改MoE训练,吞吐再飙升20%,内存省70%

最近华为在MoE训练系统给出算子和内存优化方案,三大核心算子全面提速,系统吞吐再提20%,Selective R/S实现内存节省70%,为大规模MoE模型训练扫清障碍。

新智元
算法论文8

音频大模型安全可信度的全面“体检”!6大维度,清华南洋理工联手打造

南洋理工和清华团队提出框架AudioTrust,将ALLMs评估扩至六个核心维度,探究音频模态特有问题。目前基准及平台已开发,揭示了开源与闭源ALLMs在多维度的潜在风险。

量子位
新闻资讯7

让ChatGPT连读“A”,直接崩溃到念广告词,网友:拿付费用户做测试呢?

ChatGPT付费用户体验高级语音模式时遇怪事,正常聊寿司时突然插播广告,连读“A”也会如此。网友猜测是广告插入或“幻觉”,OpenAI技术人员称是幻觉,而国产AI无此问题。

量子位
开源动态8

OpenAI未公开的o3「用图思考」技术,被小红书、西安交大尝试实现了

OpenAI推出的o3推理模型打破传统文字思维链边界,实现图像融入推理过程。小红书与西安交大联合构建多模态深度思考模型DeepEyes,尝试实现类似能力,还开源技术细节,在多任务中表现出色。

机器之心
算法论文8

北大团队发布首篇大语言模型心理测量学系统综述:评估、验证、增强

随着大语言模型(LLM)能力迭代,传统评估方法难满足需求。北大宋国杰教授团队论文首次系统梳理LLM心理测量学研究进展,革评估原则,扩展测量构念与方法,还给出增强方法与未来研究方向。

机器之心
新闻资讯7

我国的智算中心布局

结合民生证券报告和AIDC调研纪要,分析我国数据中心市场。全球数据中心建设将增长,增容量约85%投向智算中心。中国智算中心大头在中西部,还介绍了国内投资主体格局。

芯师爷
算法论文8

何恺明等降维打击!彻底颠覆AI生图,无需预训练一步到位

何恺明团队推出生成模型MeanFlow,它跳脱传统训练范式,无需预训练等,仅一次函数评估就能完成生成。在ImageNet 256×256上表现优越,缩小了一步与多步模型性能差距。

新智元
开源动态7

如何重现 DeepSeek 推理性能突破

DeepSeek-V3 是热门开源大模型,采用大规模 MoE 架构,优化推理性能是工程难点。阿里团队在 RTP - LLM 完成优化,对齐其推理系统性能,分享关键技术、不足与思考,还提及对 Qwen3 模型的优化策略。

InfoQ
算法论文8

首次披露!DeepSeek V3 发布软硬一体协同训练论文,公开「降成本」秘诀

DeepSeek团队发布论文《洞察DeepSeek - V3:规模的挑战和对AI架构硬件的思考》,从硬件架构和模型设计双重视角,探索其经济高效的大规模训练和推理方法,介绍了设计原则、低精度驱动等多方面内容及降成本秘诀。

AI科技评论
新闻资讯7

突发,美商务部叫停「AI扩散规则」藏杀机!英伟达市值再破3万亿

13日晚美商务部撤销《AI扩散规则》,该规则曾遭科技巨头和盟友反对。同时出台加强半导体出口管制措施,精准打击中国AI发展。而英伟达因规则废止受益,市值再破3万亿。

新智元