稀疏矩阵」共找到 179 篇相关文章

新闻资讯7

架构彻底重构!DeepSeek新模型代码曝光,要来的V4让国内外都坐不住了?

DeepSeek官方GitHub代码库曝光代号“MODEL1”新模型线索,或为V4内部代号。代码显示其有重大架构变更,能并行处理稀疏与稠密计算,适配英伟达新架构。此前R1发布推动中国AI开源生态发展,新模型备受期待。

InfoQ
算法论文8

FlashAttention 完全进化史:FA-4 发布之际的技术全景回顾

文章围绕FlashAttention展开,从Attention性能瓶颈引出问题,阐述其各版本演进。FA-1实现算法突破,避免O(N²)内存;FA-2适配架构,提升性能;FA-3深度协同,实现异步;FA-4探索更深异步和角色分工。还探讨跨芯片迁移及未来优化方向。

GiantPandaLLM
算法论文8

斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4

斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。

深度学习自然语言处理
新闻资讯8

MagicOS已成世界「第三极」,荣耀拿下AI大战叙事权

全球智能手机进入AI决战期,苹果、谷歌、三星等厂商各有局限。荣耀推出MagicOS 10及YOYO智能体,其具备自进化能力,背后有魔法大模型3.0矩阵支撑。荣耀在技术、生态、市场等方面全链路突破,有望执掌全球AI终端话语权。

新智元
新闻资讯8

未来智能完成亿元级A轮融资,蚂蚁集团领投、启明创投超额跟投年内连获三轮融资!未来智能A轮再获亿元级资金助力

10月13日,AI硬件公司未来智能完成亿元级A轮融资,由蚂蚁集团领投、启明创投超额跟投。本轮融资用于丰富产品矩阵、拓展海外市场、探索前沿技术。该公司聚焦办公场景,产品功能不断进阶,已实现盈利且海外市场增长显著。

AI前线
开源动态8

开启端侧长文本时代!面壁全新架构,让小钢炮最快提升220倍

2025智源大会上,面壁智能发布MiniCPM 4.0模型,实现行业首个系统级上下文稀疏语言模型创新。它在端侧推理任务上表现出色,降低缓存需求,提高运行效能,还进行多维度架构创新,是AI领域探索高效率语言模型的里程碑。

机器之心
算法论文8

只需一次指令微调,大模型变身全能专家天团,8B模型性能反超全微调基线 | ACL25 Oral

预训练大模型适应专业领域需高昂微调成本,稀疏混合专家架构虽能提升推理效率,但从头训练耗资源。浙大与Thomson Reuters团队提出SIMoE,单阶段微调就能升级大模型,还解决传统方法两大局限,在性能和效率上双突破。

量子位
新闻资讯7

具身智能开始进入「下半场」:从会干活到干完活

具身智能正处热门,国内今年上半年赛道融资额高涨。但钱与落地有落差,拉格朗日具身技术自研 Agentic OS,采用分层智能架构处理工程问题。还推动工序重构,制定技能矩阵和排期计划,其团队背景多元,赌让机器人干完活路径。

AI科技评论
开源动态8

腾讯开源三大具身基座模型,首席科学家张正友详解“三层脑”如何破解机器人反应慢

WAIC 2026 期间,腾讯开源三款具身基座模型。首席科学家张正友称此前用 OpenClaW 调度机器人效果差,后设计 TairosAgent 框架。腾讯将具身智能拆成三层,配合具身智能体和框架构成完整矩阵,还解决语言信息不足等问题,并在工业和养老场景测试。

InfoQ
上一页18 / 18下一页