四段式预训练」共找到 2358 篇相关文章

算法论文7

拟合接近满分,外推却会跑偏:Meta 给缩放律加了一个指数

大模型训练前,团队常用 Chinchilla 缩放律估算模型规模和数据量,但它在模型和数据极不平衡的边界预测易跑偏。Meta FAIR 提出的 Skaling 只增加一个耦合指数,降低外推误差,还采用 L 形采样降低试算成本。

深度学习自然语言处理
产品应用8

国产GPU开始造世界!国内首个全栈具身智能仿真平台来了

摩尔线程发布国内首个全栈国产化具身智能仿真平台MT Lambda,实现Sim-to-Real真机验证。该平台像物理AI训练流水线,集成物理、渲染、AI引擎。其依托全功能GPU和MUSA架构,还构建了云端、端侧、生态闭环。

量子位
算法论文8

小模型用不好Skill?新范式让模型学会Skill的底层逻辑,3B模型推理token省5倍,性能反超

浙江大学联合美团龙猫团队、清华大学推出SKILL0,提出技能内化思路。它在训练中引入关键机制,让小模型把技能内化到参数里。实验显示,其效果出色,token效率高,为小模型成领域专家提供新方向。

量子位
产品应用7

6 个关键维度:如何把 OpenClaw 工程化为企业可控生产力平台。

文章探讨如何将 OpenClaw 工程化为企业可控生产力平台,从多租户与共享、安全管控、企业应用集成等六个维度进行系统化设计,给出不同场景适用模式及管控思路,助力其在企业安全、高效运行。

AI大模型应用实践
新闻资讯7

多亏了自动驾驶F4,才撑起了具身智能半边天

过去一年具身智能行业融资火热,自动驾驶成创业者最大来源地之一。AI科技评论盘点了「华大地Mo」(华为、大疆、地平线、Momenta)家公司背景的具身智能企业,如华为系它石智航、智元机器人等。

AI科技评论
新闻资讯7

ChatGPT本来要5天后关掉

翁家翌在播客透露,起初推出ChatGPT是为收集用户数据,预期5天后关闭。他是OpenAI多代大模型发布贡献者,还分享了OpenAI内部情况,如模型训练、迭代速度等问题,也谈及自身经历和对AGI看法。

花叔
算法论文8

让大模型学会“像人一样”查证真伪

伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。

深度学习自然语言处理
开源动态8

社区供稿丨MiniCPM-V 4.5 技术报告正式出炉

上个月开源的多模态模型 MiniCPM-V 4.5 广受好评,今日其技术报告出炉。报告从架构、数据和训练三方面探索高效路径,提出三大技术,使模型在多任务上突破,小参数规模下性能和推理速度佳。

Hugging Face
产品应用8

拜拜Claude!阿里最强万亿模型编程秒了Opus4,实测在此

阿里推出总参数达1万亿的Qwen3 - Max - Preview (Instruct),比前一代Qwen3(235B)强倍,发布即上线。官方测评显示它打败Claude Opus 4等对手,实测其编程能力出色,后续正式版值得期待。

量子位
开源动态8

智谱AI、清华开源新视觉大模型:刷新41项纪录,同级别最强

智谱AI与清华联合开源GLM - 4.5V视觉大模型,它基于GLM - 4.5 - Air开发,架构独特。在42项主流测试中创41项新纪录,多领域表现超Qwen2.5 - VL等模型,还采用新训练策略。

AIGC开放社区