「自注意力层」共找到 1538 篇相关文章
刚刚,何恺明团队新作,「嵌入式语言流」ELF来了
何恺明团队提出ELF模型,将扩散过程置于连续向量空间,只在最后翻译成词。它用一个网络实现去噪和解码,引入自条件机制。实验显示,ELF用不到其他方法十分之一数据,生成质量全面领先。
读完这篇,你就搞懂 DeepSeek v4 了
2026年4月24日,DeepSeek全新系列模型DeepSeek - V4预览版上线并开源,评分接近‘闭源三巨头’。该模型强在1.6T参数+1M上下文,还有从attention到kernel的系统级重构与优化,在架构和工程层面均有创新。
深入理解OpenClaw技术架构与实现原理(下)
文章为《深入理解OpenClaw技术架构与实现原理(下)》,讲解各系统模块,如SandBox沙箱系统、记忆管理等,还介绍自进化、工作区与路由等机制,最后展望企业级智能体架构和应用方向演进。
LeCun三顾茅庐,谢赛宁终于入伙!新公司获投10亿美元
图灵奖得主Yann LeCun创立的世界模型初创公司Advanced Machine Intelligence(AMI)宣布完成10.3亿美元种子轮融资,估值35亿美元。DiT作者谢赛宁加入任联合创始人兼CSO,CEO是Alex Lebrun。公司目标是打造理解现实世界的智能系统。
你的电子老婆开源了!登顶GitHub热榜
GitHub热榜项目AIRI是超火虚拟主播Neuro - sama的开源版,可自托管,7×24小时在线。它能实时语音、陪玩游戏等,支持多种大模型API,还介绍了不同系统搭建该项目的方法。
RoboChallenge发布年度报告:评测标尺够权威吗?
当下具身智能行业存在缺乏真实场景验证、评测标准模糊等问题。2025年原力灵机与Hugging Face推出RoboChallenge评测平台,2026年1月更新榜单。AI科技评论从技术和核心设计角度对其进行深度拆解。
让Agent画思维导图稳固长期记忆:新框架实现稳定长期学习,准确率提升38%
中国电信人工智能研究院研究团队提出TeleMem框架,从数据结构层重新设计Agent记忆组织方式,使记忆可检索、累积、回溯和演化。该框架解决了传统RAG在长期记忆管理和持续学习方面的瓶颈,准确率提升38%。
从一行代码发现DeepSeek的秘密:Model1到底是什么?
在DeepSeek - R1发布一周年时,有人在GitHub的FlashMLA代码仓库发现神秘代号Model1,可能是V4。文章分析了代码仓库用途、新模型“露馅”原因,还从代码中发现Model1细节,结合论文梳理时间线,最后也提出了怀疑。
首个真正“能用”的LLM游戏Agent诞生!可实时高频决策,思维链还全程可见
超参数科技推出全新游戏智能体COTA,它由大模型原生驱动,操作似职业选手,决策如教练,推理链路清晰。在自研FPS游戏Demo中表现出色,还打破‘不可能三角’,有望重构游戏人机关系。
马斯克「脑机第一人」首爆!不开颅在线升级,永生代码已写入
Neuralink首位人类受试者Noland Arbaugh自曝大脑芯片更新方式和特斯拉类似,可在线升级。如今奥特曼入局,其参与创立的Merge Labs获2.52亿美金种子轮融资,要做更大规模脑机接口。