「单文件架构」共找到 2515 篇相关文章
ENG APPL COMP FLUID | 西北工业大学赵书乐、张伟伟:欧拉方程嵌入的壁面压力和摩阻分布机器学习方法
传统气动力建模依赖大量样本、泛化能力弱。本文将欧拉方程无粘特征融入建模,配合架构与损失函数设计,让模型在复杂状态保持泛化能力,集中力误差约3%,小样本建模时样本量比传统方法降2倍以上。
让NCCL性能起飞的symmetric memory是啥黑科技?— part2
本文是NCCL 2.27新特性系列的第二部分,主要分析symmetric primitives的实现机制,介绍其提供的接口,如获得symmetric ptr、barrier、send、recv、llEpoch控制等接口,还解析了底层结构内存布局、各接口工作机制及LL Buffer划分机制等。
跨芯片统一优化,DLCompiler与DLBlas驱动算子极致表现
9月10日,上海AI实验室DeepLink团队开源DLCompiler和DLBlas。前者是扩展Triton的深度学习编译器,后者是面向大模型的高性能算子库。它们有跨架构DSL扩展等亮点,在多芯片上实现性能优化,还解决了DSA芯片优化难题。
博士学位答辩PPT分享 | 基于机器学习的复杂流场预测方法研究
左奎军博士论文聚焦基于机器学习的复杂流场预测,以多种对象构建智能流场预测网络架构,发展耦合求解方法,剖析核心要素影响,提出多个创新模型和策略,还分析了不同模型在流场预测中的表现与问题。
解决扩散模型过拟合的创新框架T-LoRA
预训练大型文本到图像扩散模型定制化时,样本有限易致过拟合。AIRI和HSE大学团队提出T - LoRA框架,动态调整训练能力、用正交初始化,实验显示其在单图像和多图像任务表现优,用户更偏好其生成图像。
200行python代码实现从Bigram模型到LLM
本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。
DeepSeek-R1-0528 打榜、20+案例全面实测,全球网友狂点赞:实力堪称R2!
DeepSeek 上新的 DeepSeek - R1 - 0528 让 AI 圈沸腾。它在 LiveCodeBench 榜单飙升至第 4 位,性能逼近 OpenAI 的 o3 高级版。全球网友实测后好评如潮,其在多方面能力出色,且完全开源,引发对 R2 的期待。
打破日韩技术垄断,看国产高端MLCC如何赋能AI机器人
随着数智浪潮到来,AI 赋能的机器人革命正揭开产业变革帷幕。MLCC 作为核心被动电子元器件,已渗透至现代机器人架构中六大关键模块。不同类型机器人对 MLCC 性能要求不同,微容科技构建差异化产品矩阵,打破日韩技术垄断。
模型一模一样,Token 却相差 70 倍?三项实测揭开 AI 编程工具的成本黑洞
本文通过三项独立基准测试,证实相同AI模型下,不同AI编程智能体框架的Token消耗最高相差70倍,分析了成本差异的核心原因,为企业AI成本控制提供可落地的衡量标准。
AI圈刚开始谈Loop Engineering,两位95后博士已经盯上了人类闭环数据
AI圈热词Loop Engineering强调AI工程应从单次prompt转向设计持续运行的闭环系统。具身智能争抢人类第一视角数据,脸谱心智由95后博士创立,发布Looped World Models,还提出Ego - NeuroLoop数据范式及相关采集和增强工具。