双预训练架构」共找到 3616 篇相关文章

开源动态8

Ray异构融合底座重构数据管道:架构演进与万卡落地实践

文章指出大模型发展下,传统大数据引擎在多模态数据处理局限性凸显。腾讯基于Ray构建新一代数据管道,介绍了云原生调度与计算范式融合架构,详述容错、资源利用等方面优化实践,展示了重构收益。

腾讯技术工程
算法论文8

10个小模型并联跑赢GPT-4.1!无额外训练,方法仅4步

上海人工智能实验室等机构提出Avengers框架,无需额外训练,通过四步集结小模型优势。实验表明,其在15个数据集上平均得分超GPT - 4.1,还探究了框架有效的要素,对AI研究和开源社区意义重大。

量子位
产品应用7

训练世界模型,开始从人类的肌肉和脑子里偷师了

具身智能数据竞争进入新阶段,第一视角视频虽缓解数据量问题,但未记录人行动的原因及大脑身体实时修正。FaceMind提出Ego - NeuroLoop数据范式,配套NeuroMatrix和NeuroBooster,将训练数据从“行为库”推向“闭环库”。

量子位
推荐文章7

如何为 GPU 提供充足存储:AI 训练中的存储性能与扩展性

文章分析 MLPerf Storage v2.0 测试结果,探讨不同存储系统在 AI 训练中表现。在满足 GPU 利用率阈值下,能支撑更多 GPU 的存储系统扩展性与稳定性更强,还需关注资源利用率。以太网存储方案灵活且成本效益高。

AI前线
算法论文8

蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据

蚂蚁集团论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获VLDB工业赛道最佳论文。其研发的OmniTable系统能管理超35PB、3050亿条以上训练数据,解决数据准备难题,如在SFT任务中大幅缩短周期。

量子位
算法论文8

告别「利用率崩溃」:GIPO开启大模型强化学习高效训练新方法 | ICML 2026

树根科技与三一集团团队联合提出 GIPO 算法,在机器人操控及大语言/视觉动作模型强化学习训练中,缓解了策略滞后痛点,改善了 PPO 硬截断引发的‘利用率崩溃’问题。介绍了 GIPO 算法原理、优势及实验结果。

AI科技大本营
推荐文章7

最新 AGI 暴论:强化学习的「GPT-3 时刻」实现,还需要 1 万年?

国外AI初创公司Mechanize三位创始人联合撰文称,RL或迎“GPT - 3时刻”,但需数千至上万年“模型处理任务所用时间”训练。还提出“复制训练”新范式,能磨炼模型能力,补足短板。

AI科技评论
开源动态8

开启端侧长文本时代!面壁全新架构,让小钢炮最快提升220倍

2025智源大会上,面壁智能发布MiniCPM 4.0模型,实现行业首个系统级上下文稀疏语言模型创新。它在端侧推理任务上表现出色,降低缓存需求,提高运行效能,还进行多维度架构创新,是AI领域探索高效率语言模型的里程碑。

机器之心
开源动态8

【深度长文】从“会聊天”到“能干活”:OpenClaw架构深度拆解与价值挖掘

文章深度拆解 OpenClaw 架构,指出传统 SaaS 走向末路,OpenAI Operator 有局限。OpenClaw 以本地原生机制崛起,具备诸多优势,还介绍了其安全方案及五大高价值商业场景,鼓励关注学习。

AI前线
算法论文8

比Transformer更强的架构来了?浙大新作Translution,一统卷积和自注意力

随着大模型发展遇瓶颈,浙大等校学者提出神经网络基础操作Translution,实现自注意力与卷积的融合统一,构建更普适神经计算机制。它性能超Self - attention,为新一代神经网络发展开辟新方向。

新智元