「超参数科技」共找到 3386 篇相关文章
揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路
上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。
一文看懂华为昇腾芯片
文章介绍华为昇腾芯片,它是面向高性能AI计算的NPU芯片,有昇腾310、910、610等系列。还提及芯片演进、参数、价格、出货量等情况,以及基于芯片的硬件体系,覆盖多场景满足不同需求。
微信自研高性能推理计算引擎 XNet-DNN:跨平台 GPU 部署大语言模型及优化实践
本文深入解析微信自研的高性能推理计算引擎 XNet-DNN,介绍其核心技术架构和性能优化策略。该引擎基于 RCI 框架构建跨平台 GPU LLM 推理能力,在多方面超越现有解决方案,还给出了详实对比实验数据。
英伟达再创历史纪录!Q1收入增长69%,数据中心贡献89%,游戏业务大涨42%
英伟达2026财年Q1财报亮眼,总收入441.1亿美元,环比增12%、同比涨69%。数据中心和游戏业务表现出色,分别占比近89%、创新高。不过H20芯片受出口限制影响,预计二财季收入减80亿美元。
刷新世界记录!40B模型+20万亿token,散户组团挑战算力霸权
Nous Research推出Psyche网络,用区块链汇聚全球计算资源,启动40B参数大语言模型Consilience预训练,达20万亿token创纪录。还解决带宽瓶颈等问题,让AI训练去中心化,推动创新与民主化。
AI全面爆发后,企业正在悄悄争夺知识库入口|甲子光年
AI幻觉问题让企业意识到通用模型在专业场景的局限,需构建企业级知识库。腾讯在峰会上宣布升级知识库产品,乐享知识库通过AI赋能解决数据整合、更新等痛点,未来知识库将与业务深度联动。
甲小姐对话柳钢:AI编程商业化的中国解法 | 甲子光年
AI编程赛道发展火热但商业化难题凸显,国内外市场境遇不同。极狐GitLab CEO柳钢将困境转化为突破口,推出驭码CodeRider。他认为用AI赚钱时代已到,还分享对产品、商业、开源等方面的看法。
全新GPU高速互联设计,为大模型训练降本增效!北大/阶跃/曦智提出新一代高带宽域架构
随着大模型参数规模扩大,分布式训练成关键路径,高带宽域设计对提升训练效率至关重要。现有HBD架构在可扩展性、成本和容错能力等方面有局限,北大、阶跃、曦智团队提出InfiniteHBD架构解决问题。
一码难求的 Dia 浏览器,有了新进展
Dia 浏览器处于 Alpha 内测,需邀请码体验。测试反馈超预期,将打磨细节后发布。其优势是使用 AI 时能方便代入上下文信息,Chat 交互将成主流,Arc 部分功能会融合进 Dia。
7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开
北京中关村学院7名跨专业博士生,耗时3个月从零训练出7B参数大模型ZGCM-1,采用数百个Agent协作实践AI4AI研发范式,全程公开代码、数据、权重、训练日志,分享一线实战经验。