「扩展定律」共找到 512 篇相关文章
揭示扩散语言模型扩展定律,人大高瓴团队与蚂蚁集团发布LLaDA MoE v2
中国人民大学高瓴人工智能学院与蚂蚁集团合作,首次系统刻画混合专家扩散语言模型扩展定律,据此训练LLaDA MoE v2,实现扩展效率与智能双重突破,将推动其迈向规模化时代。
ParScale:一种全新的大模型Scaling Law
文章提出并行扩展(ParScale)路线,在不增模型参数下,通过引入并行流提升性能。新扩展定律打破传统范式,两阶段后训练策略降成本,还适用于边缘设备,研究仍在进行。
黄仁勋 × Lex Fridman:NVIDIA 4 万亿市值背后的 AI 革命
黄仁勋与Lex Fridman进行两小时访谈,从Amdahl定律聊到人类意识。谈及NVIDIA发展,如CUDA决策致市值下跌后回升;提出AI扩展定律,认为智能由算力决定;还分享管理、技术预判等看法及对中国创新的评价。
新范式来了!新能量模型打破Transformer++扩展上限,训练扩展率快35%
研究训练新能量模型 EBT,为输入和预测分配能量值,模拟思考过程。它有跨模态、跨任务通用性,训练扩展率比 Transformer++ 高 35%,推理性能提升 29%,还在多任务中表现出色,是扩展模型能力新范式。
精读华为“韬(τ)定律”论文:逻辑折叠、AI提速与投资转向|甲子光年
2026年5月25日,华为何庭波提出“韬(τ)定律”,并提交论文阐述。该定律把时间作为首要度量标准,核心技术“逻辑折叠”提升芯片性能。它能用于AI,未来硬件集成度将大增,也会使产业链价值重分配,但面临工具链、能量等问题。
6年量产381款芯片!华为用"韬τ定律"实现突破
5月25日,华为何庭波在ISCAS 2026演讲发表“韬(τ)定律”,以“时间缩微”替代“几何缩微”。华为6年量产381款芯片,今年秋将推麒麟2026。该定律是多层级协同体系,有望绕过高端设备封锁。
教你构建私有 AI Coding 平台:Pi、DSH、Codex Harness 扩展能力对比与选型。
文章聚焦构建私有AI Coding平台,对比Pi、DeepSeek Harness、Codex Harness的架构、扩展能力及选型策略。介绍三者交互集成方式,分析其扩展特点,并为不同需求团队给出选择建议。
华为韬定律拆解:等效 1.4nm 是真是假,产业格局怎么变
华为半导体业务部总裁何庭波提出韬(τ)定律,引发市场热议。文章从多层面剖析,介绍其核心、与摩尔定律差异,分析技术突破与包装话术,探讨全球产业链影响、国内板块格局及估值,还给出分析框架与观察要点。
重磅!华为何庭波正式提出τ缩放定律,晶体管密度直指1.4纳米,麒麟2026首发验证
2026年,华为何庭波提出τ缩放定律,主张将时间常数τ作为半导体演进首要优化目标。该定律在手机端和AI数据中心验证有效,还涉及产业结构变化,但仍有工具链、工艺变异等问题待解。
微软等提出「模型链」新范式,与Transformer性能相当,扩展性灵活性更好
随着大语言模型发展,扩展 Transformer 架构成趋势,但参数规模增长带来训练负担。微软等研究者提出 CoR 概念,构建模型链学习范式,应用于语言模型得 CoLM 系列,实验显示其性能相当且扩展性、灵活性更好。