大模型预训练」共找到 9479 篇相关文章

新闻资讯7

陈天桥重磅出手!20瓦人脑秘籍,AI模型瞬间「破防」

上周六,天桥脑科学研究院创始人雒芊芊宣布成立尖峰智能实验室,由李国齐教授领衔,致力于类脑模型和脉冲神经网络研发。该实验室是‘发现式智能’理念落地载体,将借鉴人脑特性研发类脑模型

新智元
算法论文8

告别「利用率崩溃」:GIPO开启模型强化学习高效训练新方法 | ICML 2026

树根科技与三一集团团队联合提出 GIPO 算法,在机器人操控及语言/视觉动作模型强化学习训练中,缓解了策略滞后痛点,改善了 PPO 硬截断引发的‘利用率崩溃’问题。介绍了 GIPO 算法原理、优势及实验结果。

AI科技大本营
新闻资讯8

全国首部!AI 模型私有化部署标准起草单位 / 个人征集启动!

国内首部AI模型私有化部署标准《人工智能模型私有化部署技术实施与评价指南》立项,正征集起草单位和起草人。该标准全流程覆盖、多方面融合、三方协作,能解决企业部署痛点,构建安全可信生态。

AI大模型应用实践
算法论文8

高瓴赵鑫团队新作:先拆掉 RLVR,再重建推理模型训练

高瓴赵鑫团队围绕RLVR框架做系统实验,完成论文《A3PO: Adaptive Asymmetric Advantage Shaping for Reasoning Models》,提出A3PO方法。该方法将训练重点转向关键决策点,让推理模型学习更可控。

AI科技评论
算法论文8

首个GUI多模态模型智能体可信评测框架+基准:MLA-Trust

MLA-Trust 是首个针对 GUI 环境下多模态模型智能体的可信度评测框架,构建了涵盖四核心维度的评估体系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。

机器之心
产品应用8

单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地

3月25日,硅心科技发布专为代码变更应用场景设计的轻量级模型aiX - apply - 4B。该模型在准确率、推理速度等方面表现出色,超越部分千亿级模型,还推出“模型+小模型”协同架构释放企业算力价值。

量子位
开源动态8

微软开源2025 ICML获奖框架,终结模型多轮对话严重缺陷

微软开源2025年ICML获奖框架CoLLabLLM,可解决模型多轮对话缺陷。它由四模块构成,经多轮对话模拟和奖励优化模型。在三基准平台测试显示,能在多样任务中高效协作。

AIGC开放社区
算法论文7

MoE RL 实战:统一 FP8 全流程训练

SGLang RL 团队等实现 RL 全流程 FP8 训练与采样,消除训推不一致性。介绍 FP8 硬件基础、格式等,分析训练难点,定位 KL Loss 异常源于量化原理,验证其在 MoE 模型 RL 场景优势,指出模型规模与训推不一致的关联。

GiantPandaLLM
开源动态8

Meta 新成立超级智能实验室,让模型RAG推理速度飙升30倍

Meta新成立超级智能实验室(MSL),首篇论文REFRAG将RAG推理速度提升30倍以上。它先把上下文压缩成摘要再解码,减少计算量和延迟,在多任务测试中表现出色,为模型部署提供实用方案。

AIGC开放社区
开源动态7

开源端到端语音模型:直接从原始音频输入,生成语音输出

目前模型多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。

AIGC开放社区