「72B参数量」共找到 1245 篇相关文章
不换GPU,性能飙升2.8倍!英伟达用软件暴打摩尔定律
2026年1月8日,英伟达官网披露,基于Blackwell架构的推理软件栈升级,让混合专家模型(MoE)推理效率迎「阶跃式」突破,单GPU吞吐飙升2.8倍,显著降低推理成本。其通过软件针对性升级发挥硬件潜力,还进行多项优化。
Generalist最新长文定调:具身原生才是正道,中国玩家原力灵机已交卷
Generalist创始人Pete Florence团队释出GEN-1技术博客,否定世界模型与VLA之争,强调具身智能应回归目标,主张从零训练。中国原力灵机DM0也采用具身原生路线,在RoboChallenge评测中成绩优异。
三星研究院发布手机端侧大模型MeKi:基于Memory的LLM扩展新范式,支持旗舰手机端侧部署
三星研究院发布端侧大模型架构MeKi,提出用存储空间扩展模型容量、提升LLM性能的新范式。它利用手机ROM缓解内存压力,实现容量与性能提升。实验显示其性能、效率表现优,为边缘部署LLM提供新思路。
DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透
DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出全新范式及Engram模块,解决传统N - gram问题,研究稀疏性分配,验证推理能力提升,兼顾工程优化。
刚刚,DeepSeek 突发梁文锋署名新论文:V4 新架构提前曝光?
今天凌晨,DeepSeek在GitHub开源新论文与模块Engram,论文提出“查—算分离”机制,通过可扩展查找记忆结构提升模型表现。Engram将记忆与计算职责分离,或成V4核心技术,获网友肯定。
摩尔线程算法一鸣惊人,图形学顶会夺银!已开源
12月17日,在SIGGRAPH Asia 2025上,摩尔线程凭借自研技术LiteGS在3DGS重建挑战赛中获银奖。3DGS是革命性3D场景表示与渲染技术,摩尔线程开源3DGS基础库LiteGS,实现全链路协同优化。
被DeepSeek带火的OCR,最新8个开源模型盘点~
DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。
「一页纸」吃透产业链之:人形机器人,Figure链与特斯拉Optimus链
文章聚焦人形机器人,分析其产业处于量产落地拐点,2025 - 2026年是关键期。介绍产业链上中下游情况,指出面临的软硬件挑战,还提及市场规模、主要参与者,重点关注Figure与特斯拉Optimus产业链。
Scaling Law再现Agent领域!阿里提出训练新范式:在预训练和后训练之间还需一个Agentic CPT
近年来,大型语言模型向智能体系统进化。但当前主流方法构建智能体不佳,阿里通义实验室团队论文提出智能体持续预训练(Agentic CPT)新范式,开发AgentFounder模型,在多基准测试表现卓越。
首次人体实验成功!基因编辑胰岛细胞“隐身”植入,可正常分泌胰岛素
最新研究显示,科学家首次将CRISPR编辑的胰岛细胞移植到一名1型糖尿病患者体内,细胞数月内持续分泌胰岛素,还能逃避免疫检测,使接受者无需服免疫抑制剂。不过研究仅涉一人,Sana计划明年开展更多试验。