「笔记式形态」共找到 882 篇相关文章
【CUDA-MODE学习笔记】Lecture 40: CUDA Docs for Humans(文末送书
本文是CUDA-MODE课程笔记,介绍Modal公司GPU术语词汇表项目,讲师分享职业历程,强调理解CUDA技术栈各层次重要性,还讨论了项目短、中、长期目标,是助力开发者掌握CUDA的教育项目。
从 Rule、Spec 到 Harness:AI Coding 的渐进式建设路径
作者分享帮团队落地AI Coding经验,指出试点易但推广难,瓶颈在接收端。介绍从Rule、Spec、Loop到Harness的渐进式建设路径,各层前后相依,逐层收紧控制面,助AI在工程体系稳定交付。
CUDA-MODE第77课课程笔记:用于GPU kernels的DSL
该课程笔记由Tri Dao介绍GPU kernel开发的DSL生态,涵盖PyTorch、Triton、Cute - DSL等。提出计算效率评估公式,对比不同DSL在Softmax、GEMM等操作的性能。还提及其他DSL工具与Triton扩展项目,并给出使用建议。
科研的回归:AutoSOTA如何终结“增量式优化”的重复劳动
当前AI科研中,为提升性能指标,研究者投入大量精力做“增量式优化”,限制原创探索。AutoSOTA项目由清华与中关村学院联合发布,它基于智能体系统构建自动化方案,接管实验迭代,一周发现105个SOTA模型,推动科研回归原创。
微软研究院BioEmu登上Science,用生成式AI重塑蛋白质功能研究
7月10日,微软研究院AI for Science团队在《Science》发表成果,提出生成式深度学习模型BioEmu,结合多类数据训练,能模拟蛋白构象变化,有多项核心创新,已开源,未来将拓展应用场景。
LLM学习笔记:最好的学习方法是带着问题去寻找答案
文章总结拓展Andrej Karpathy教学视频,分析大模型聊天流程与原理,介绍LLM训练步骤,包括预训练、后训练和强化学习,还提及主流特性应用,如文件上传、网络搜索,强调带问题学习的重要性。
RPA要没了
Codex更新Record & Replay功能,虽与RPA表面都是录制操作、重复执行,但底层逻辑不同。RPA是指令式,有诸多缺陷;Codex是目标式,是RPA替代品,还构建了企业自动化体系。
NVIDIA技术沙龙 《大规模EP优化:PD分离MoE并行方式》课程笔记
本文是NVIDIA技术沙龙课程笔记,介绍大规模EP优化的PD分离MoE并行方式。涵盖PD分离、大规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。
NVIDIA技术沙龙《强化学习流水线优化:性能分析与 Rollout加速》演讲笔记
该演讲笔记围绕强化学习流水线优化,强调用Nsight Systems做性能分析,介绍在Ray Actor添加参数及解读文件方法。给出训练/生成参数优化技巧,如Actor训练和Rollout优化,还以Qwen 2.5 7B等模型为例总结参数调优经验。
UW天才少女官宣入职OpenAI!46场面试,地狱级求职笔记刷屏
华盛顿大学华裔女博士Alisa Liu为入职OpenAI经历57轮面试,事后公开面试准备笔记成“LLMs面试圣经”。她分享求职经验,如合理安排面试、刷题备考、每场面试专门准备、学会薪资谈判等。