「计算范式转移」共找到 1679 篇相关文章
【博客转载】CUDA Kernel Execution Overlap
文章讨论CUDA kernel执行重叠,指出有足够计算资源时可重叠,通过调整`blocks_per_grid`值,观察到不同并行化程度。还提到隐式同步会影响重叠,可启用`per-thread` default Stream 禁用。
基于风雷软件的NF3数字风洞
在第四届智能流体力学产业联合体大会发布的数字孪生风洞「风神NF3」相关技术在《太阳能学报》发表。基于风雷软件构建西北工业大学NF - 3数字风洞,可自动生成网格、高效计算,实现飞行器翼型数值模拟自动化和业务化运行。
为什么你的 AI Agent 总是用不起来?答案在 Skills
文章围绕AI Agent的Skills展开,介绍其范式价值,如从“单一智能”到“模块化智能”;还提及知识沉淀、跨平台能力迁移等作用,以及对人机关系、人力市场与劳动结构的影响。
英伟达斥资50亿美元入股英特尔
18日,英伟达与英特尔宣布深度合作,联合开发产品。英伟达将斥资50亿美元入股英特尔,双方以NVLink技术连接架构,合作聚焦数据中心和个人计算领域,旨在提升运行效率,填补产品空白。
2026年半导体涨价已成常态,谁在狂欢?谁在承压?
2026年半导体行业进入AI驱动的超级周期,涨价常态化、供需失衡、竞争逻辑重构。AI服务器对芯片需求大,产能转移致供应缺口,成本推动价格上涨,全产业链受影响,终端厂商困境凸显,行业分化加剧。
2026!开年关键词:Self-Distillation,大模型真正走向「持续学习」
2026 年刚开始,大模型领域研究者达成默契,arXiv 论文高频出现 Self-Distillation。传统强教师依赖范式难适配模型持续进化,Self-Distillation 成破局点。MIT 等机构发布三项研究成果,均用信息差实现模型自驱动升级。
美团龙猫LongCat技术升级!新注意力机制解码速度快10倍,还能处理1M超长文本
美团龙猫LongCat系列发布全新稀疏注意力机制LoZA,重点解决长文本任务难题。它在MLA机制基础改造,计算复杂度降至线性,处理128K上下文解码快10倍,性能不缩水,后续还计划支持动态稀疏比例。
Qwen-AgentWorld:一个语言世界模型,模拟七大Agentic领域
今天正式发布 Qwen-AgentWorld,它是首个原生语言世界模型,能在七大领域模拟智能体交互环境。同步发布 AgentWorldBench 评测基准。Qwen-AgentWorld 经三阶段训练,在评测中表现出色,还探索两种范式增强通用智能体能力。
Karpathy戳破强化学习神话,首提AI复盘式进化!暴力试错将死
AI大神Karpathy发文指出强化学习(RL)有局限,效率随任务时长下降,与人类学习机制差异大。他提出复盘式进化Scaling范式,虽有很多细节待完善,但认为还有更多S型增长曲线待发现。
谷歌新论文把内存股价干崩了!KV cache压缩6倍,“谷歌的DeepSeek时刻”
谷歌研究院推出TurboQuant压缩算法,可将AI推理中最吃内存的KV cache压缩至少6倍且精度零损失,还能8倍加速计算。虽引发存储芯片巨头股价下跌,但目前只是实验室成果,仅解决推理阶段内存问题。