超节点架构」共找到 3770 篇相关文章

算法论文8

Self-Forcing++:让自回归视频生成模型突破 4 分钟时长极限

加州大学洛杉矶分校与字节Seed等团队联合完成Self-Forcing++,让自回归视频生成模型突破4分钟时长极限。它解决传统模型架构缺陷,经三步技术实现稳定长视频生成,实验基线,但仍有长时记忆缺失等问题。

机器之心
算法论文8

只需1/4预算,性能反基线:阿里高德提出Tree-GRPO,高效破解智能体RL难题

阿里高德提出Tree - GRPO方法解决智能体RL难题。它以智能体步骤为节点树搜索,在11个数据集中更省预算、表现更好,能在1/4预算GRPO基线,解决了Rollout成本高和监督稀疏问题。

机器之心
新闻资讯8

微软刚发布Mu模型:支持Windows智能体,小参数跑出10倍性能

今天凌晨微软发布创新小参数模型Mu,3.3亿参数性能比肩Phi - 3.5 - mini,体量小10倍,离线NPU笔记本每秒100 tokens响应。它支持Windows智能体,架构有多项创新,经训练优化后智能体表现出色。

AIGC开放社区
新闻资讯7

英伟达最新芯片B30A曝光

最新消息,英伟达正开发代号B30A的AI芯片,性能H20,基于Blackwell架构,单芯片配置,原始算力或为B300 GPU双芯片一半,下月交付测试。此外还将开发RTX6000D用于AI推理,9月小批量交付。

量子位
产品应用8

登顶TPC-C!数据库分布式扩展技术揭秘

阿里云PolarDB云原生数据库以原记录2.5倍性能登顶TPC - C基准测试排行榜。本文揭秘PolarDB MySQL版多主集群(Limitless)架构与核心技术,还介绍高可用机制、性能测试结果,最后提及轻量版和列存索引应用。

阿里云开发者
算法论文8

DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了

DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构和模型设计双重视角,探讨实现经济高效的大规模训练和推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。

机器之心
开源动态8

Qwen3.8-Flash-Next:SGLang Day-0 支持

2026年8月26日,Qwen团队开源多模态MoE模型Qwen3.8-Flash-Next,是Qwen4架构早期预览版。SGLang在发布首日提供完整支持,模型架构多方面升级,亮点众多,还介绍各组件优化及PLE架构与卸载优势。

GiantPandaLLM
产品应用8

TDSQL Boundless:AI时代的多模态数据库

在AI与数据分析处理技术融合的当下,传统数据库架构面临诸多挑战。腾讯云TDSQL Boundless推出,通过统一架构处理多模态数据。本文从核心架构、关键技术特性及对未来数据平台建设的启示三方面解读。

InfoQ
新闻资讯7

英伟达半数打工人身家过亿!难怪离职率低

一份调查显示英伟达约半数员工身家2500万美元,78%百万美元。管理层富翁数字更惊人,公司离职率仅3.7%。其造富源于员工持股和限制性股票计划,近期又宣布芯片量产。

量子位
新闻资讯7

MiniMax 技术闭门会分享:长上下文是 Agent 的 Game Changer

MiniMax 7月10日举办M1技术研讨会,探讨模型架构创新等领域。会议围绕RL能否赋予模型新能力、预训练价值等展开,指出长上下文是Agent的Game changer,混合架构将成主流,还分享了混合架构推理实践及M1相关问答。

Founder Park