「后Transformer架构」共找到 3750 篇相关文章
长上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破
月之暗面团队的Kimi Linear模型,是混合线性注意力架构,核心是Kimi Delta Attention模块。它解决线性注意力的记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效长上下文模型研究。
Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana
北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。
Sora2“复活”已故名人,家属强烈反对
Sora 2走红后肖像权问题成焦点,有人用其“复活”迈克尔·杰克逊、罗宾·威廉姆斯等已故名人。罗宾女儿等家属强烈不满,OpenAI称公众人物及其家属应控制形象使用,美影协要求其解决侵权问题。
700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆大模型推理
今年6月Sapient Intelligence提出的HRM影响大模型推理结构,四个月后三星研究员Alexia Jolicoeur - Martineau推出TRM,700万参数模型在推理基准测试中超越参数多10000倍的模型,还介绍了TRM原理、改进及实验结果。
OpenAI和DeepMind大佬离职联手,誓用AI科学家实现室温超导!已融3亿美元
OpenAI后训练负责人和DeepMind的AI4S大佬离职成立Periodic Labs,专注用AI Agent改造科研,攻克室温超导等难题,已获3亿美元融资。团队目标是培养AI科学家,构建自主实验室,还将应用于产业。
OpenAI一口气建5个算力中心!英伟达喂饱孙正义和甲骨文
英伟达计划给OpenAI一千万美元新投资,OpenAI宣布将和甲骨文及软银合作建五个数据中心,作为奥特曼“星际之门”计划一部分。OpenAI与甲骨文合作熟络,英伟达分批投资,不过其投资金额及资金缺口引疑问。
又一款国产高性能GPU问世,实力对标海外巨头
2025年9月22日,芯动科技发布“风华3号”全功能GPU,它架构全面,功能覆盖广,在大模型等领域有多个突破,还适配多生态与系统。该产品能为多行业定制服务,标志国产GPU进入规模化应用阶段。
Java 30周年献礼:新LTS版本Java 25,服务器内存砍掉22%,AI开发起飞
2025年9月16日,Oracle推出Java 25,这是继JDK 21后首个LTS版本,官方提供八年支持。它含18个JDK增强提案,目标是优化AI运行、安全防护等,在省内存、提速度、简语法等方面均有显著改进。
时隔多年,AI芯片又是华为发布会主角了
华为全联接大会上,轮值董事长徐直军带来全球最强算力超节点和集群。公布昇腾、鲲鹏芯片未来2年演进规划,还开创灵衢互联协议。虽单芯片受限,但集群层面有望实现超越。
DeepDiver-V2来了,华为最新开源原生多智能体系统,“团战”深度研究效果惊人
华为发布DeepDiver-V2原生多智能体系统,采用“团队作战”模式,在复杂知识问答和长文报告生成上表现出色。它以Planner为中心协调多个Executor,有智能任务分解等优势,训练也有新机制,昇腾NPU集群加速。