「注意力算子库」共找到 501 篇相关文章
刚刚,英伟达CUDA迎来史上最大更新!
几个小时前,NVIDIA CUDA Toolkit 13.1 正式发布,英伟达称这是 20 年来最大更新。此次更新包括 NVIDIA CUDA Tile 发布、Runtime API exposure of green contexts 等,还涉及软件、多进程服务、开发者工具、数学库等多方面改进。
超越单文件代码生成:微软发布的ZeroRepo如何规划构建3.6万行大型软件?
微软等团队提出Repository Planning Graph(RPG),开发ZeroRepo框架,实现从零生成大规模代码库。RepoCraft基准实验显示,ZeroRepo功能覆盖率81.5%,代码近3.6万行,超现有基线,为AI驱动的软件工程开辟新路径。
Anthropic刚刚宣布Claude Sonnet 4支持100万token上下文窗口
Anthropic官方公告,Claude Sonnet 4上下文窗口扩大到100万tokens,是之前5倍。能一次读懂大代码库或多篇论文,可用于代码分析、文档处理等。超20万tokens价格翻倍,现仅对Tier 4用户测试。
英伟达为机器人推出懂推理的“大脑”!升级版Cosmos世界模型来了
在SIGGRAPH大会上,英伟达推出全新升级的Cosmos世界模型,重点升级规划能力与生成速度。还升级配套软硬件,如Omniverse库等。英伟达全力布局机器人领域,认为图形与AI融合将变革该领域。
让你抄袭都跟不上节奏
最近 Dia 连更两小版本,推出 Skills Gallery 和 Research 功能,即扩展技能库和深度研究能力。它更新似微信,节奏快创意足,让对手难抄袭。目前免费,仅 M 芯片苹果电脑可用,文末有邀码获取方式。
OpenAI 开源模型泄露:六大技术细节
OpenAI 可能发布的开源大模型细节泄露,包含两款模型,1200 亿参数 MoE 模型和 200 亿参数稠密模型,专注文本处理。还涉及训练技术、激活函数、上下文窗口、注意力机制及底层架构等方面的技术细节。
独白:OpenAI前员工的深度反思
OpenAI前员工在博客分享工作体验,从文化、技术等多维度剖析公司。指出极速扩张面临挑战,文化独特,技术上用Python单体代码库、依赖Azure,还详述Codex项目诞生,认为AGI竞赛在OpenAI等三家展开。
【博客转载】Row-Major VS Column-Major
文章探讨行主序和列主序存储多维数组的差异,以及对矩阵乘法性能的影响。指出不同存储顺序组合下矩阵乘法的偏好,还通过C++单线程实现和cuBLAS库验证分析,表明优化可减少性能差距。
阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了
阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。
视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26
清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。