「矩阵加载」共找到 139 篇相关文章
AI甚至开始抢土木老哥的工作了
即便土木、建筑等传统行业,也受AI冲击。建筑业用AI克隆老师傅、替代部分人力,如Procore推出多款AI智能体,Skanska建立AI安全智能体。建筑AI生态矩阵正形成,国内需相关工具。
重磅!Google 推出AlphaEvolve 实现算法自我进化,将颠覆数学与计算机科学!
Google DeepMind发布革命性的Gemini驱动编码代理AlphaEvolve,能设计并优化算法。它发现更快矩阵乘法算法、解决开放性数学问题,还优化了Google多方面计算基础架构,未来跨领域应用前景广。
CUTLASS CuTe GEMM细节分析(一)——ldmatrix的选择
作者作为CUTLASS CuTe初学者,记录问题分析过程。本文聚焦如何基于TiledMMA及输入矩阵在Shared Memory上的Layout选合适Copy Operation完成拷贝,结合实例讲解ldmatrix指令选择,还给出参考代码。
惊讶!!!3.2 万 Star OpenViking,让你的原地起飞!!!
OpenViking有3.2万Star,它把记忆、文档、提示词等上下文统一成可浏览地址空间,设计三层信息按需加载,检索留轨迹,还接入多种工具。不过它处Alpha阶段,用前要考虑许可证。
【CUDA博客】关于TensorCore和Inline PTX Assembly的一个超简短笔记
文章围绕TensorCore和Inline PTX Assembly展开,介绍利用PTX指令发挥TensorCore潜力。讲述矩阵乘法和累加操作,给出半精度及替代浮点指令形式,有代码示例并分析,还提到不同数据类型用法及SASS指令。
ICML 2025 Spotlight|华为诺亚提出端侧大模型新架构MoLE,内存搬运代价降低1000倍
华为诺亚和北大研究人员提出端侧大模型新架构MoLE。它解决传统MoE显存开销大、传输延迟高问题,推理时将专家输入改embedding token,用查找表替代矩阵运算,实验显示性能与MoE相当,大幅降推理延迟。
跨层压缩隐藏状态同时加速TTFT和压缩KV cache!
论文 UNCOMP 被 EMNLP 2025 主会接收,提出高效推理框架,用截断矩阵熵解释 LLM 稀疏化,据此设计 UNCOMP 框架,通过压缩隐藏状态优化 KV Cache,实现计算与内存联合优化,实验效果显著。
迈向可编程观测:在GPU Kernel中构建类eBPF风格的性能探针
文章从CUDA基础讲起,以矩阵乘法为例介绍性能调优,再到PTX汇编知识,最后引入Neutrino框架构建可编程GPU性能探针。展示了GPU Kernel性能分析从宏观到微观的技术演进,提供新分析视角。
超长 Agent 任务如何不崩盘:Claude Code 上下文管理机制深度拆解。
文章深度拆解Claude Code上下文管理机制,包括七类上下文、预算与告警、加载、卸载机制等。指出其是分层缓存与多级预算管理系统,还为长任务Agent开发者提供了管理启示。
关于Claude Skills,我给你写了份82页的白皮书
作者关注Claude Skills功能已久,使用后感受是它让Claude学会按需加载。还解析了Skills、MCP、Sub - agents区别,指出有人认为Skills比MCP更重要,最后介绍82页白皮书内容及获取方式。