「神经网络架构」共找到 1910 篇相关文章
Thinking Machines 发布第二篇博文:用模块化流形让训练更加稳定高效
Thinking Machines实验室发布第二篇Connectionism研究文章,提出模块化流形理论框架,通过在权重矩阵施加流形约束让神经网络训练更稳定高效。文章从几何角度思考优化问题,提出流形Muon优化器,还探讨了模块化流形扩展到大型网络的方法。
GPU到底是如何工作的?这篇AI Infra入门全部告诉你
本文详细介绍了GPU工作原理及编程模式。它从图形渲染发展到GPGPU,NVIDIA推动其通用计算。还阐述了CPU/GPU异构架构,对比二者性能,介绍编译、加载、启动过程,以及GPU硬件架构、编程与执行模型,分析SIMD和SIMT。
微软刚发布Mu模型:支持Windows智能体,小参数跑出10倍性能
今天凌晨微软发布创新小参数模型Mu,3.3亿参数性能比肩Phi - 3.5 - mini,体量小10倍,离线NPU笔记本每秒超100 tokens响应。它支持Windows智能体,架构有多项创新,经训练优化后智能体表现出色。
Andrej Karpathy 爆火演讲刷屏技术圈:AI 开启软件 3.0,重写一切的时代来了!
Andrej Karpathy 在旧金山 AI 创业学校演讲,指出 AI 开启软件 3.0 时代,自然语言成编程接口。软件经历 1.0 代码、2.0 神经网络权重,现进入 3.0 用提示词编程大模型阶段,还探讨大模型特性、应用及相关问题。
浙江,冲出一匹碳化硅芯片全球黑马!
在‘双碳’目标与数字中国建设蓝图下,电能管理机遇巨大。黄兴博士指出将供电架构优化为高压直流可降低能耗,关键在于碳化硅功率芯片。其创办的派恩杰半导体,自主研发芯片,从芯片到封装助力客户,迎来产业机遇。
多智能体在「燃烧」Token!Anthropic公开发现的一切
Anthropic发布多智能体研究系统构建解释,解决多智能体研究困惑。多智能体系统优势明显,在特定任务中表现出色,但token消耗大。其架构独特,还介绍了提示词工程、评估方法、面临的工程挑战等内容。
机器人需要一个「思考系统」:τ0-VLA让具身智能迈向长程任务时代
2026 WAIC落幕,具身智能成焦点。当前VLA模型在长程任务中有局限,上海创智学院和智元机器人联合发布τ(0)-VLA,提出分层架构和新推理机制,用大量真机数据训练,在长程任务表现出色。
罗福莉执掌小米大模型首秀!定调下一代模型,全新MiMo-V2开源还横扫Agent第一梯队
在2025小米人车家全生态合作伙伴大会上,罗福莉首秀解读全新大模型MiMo - V2 - Flash,该模型已开源,采用MoE架构和MTP技术,在多方面表现出色,罗福莉还阐述其设计逻辑与对下一代智能体的看法。
英伟达官方推理指南来了!6倍无损加速,最优解全是华人写的
9月2日,英伟达技术博客上线《用投机解码做AI模型协同设计》,给出推理加速选型表。列入指南的核心方案多由华人团队主导,介绍了从外置草稿模型到n - gram查表法等方案,还提到硬件常数对模型架构的约束。
全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货
美团推出LongCat-2.0,是首个在国产算力上实现全链路训推闭环的万亿参数模型。它多项性能强,适配主流编程工具,架构设计原创,还证明了国产算力有支撑大模型迭代的能力,训推成本更低。