训练 - 推理不匹配」共找到 3626 篇相关文章

算法论文8

北大彭一杰教授课题组提出RiskPO,用风险度量优化重塑大模型后训练

北大彭一杰教授课题组提出 RiskPO,解决大模型后训练陷入「均值陷阱」问题。它将风险规避理念融入优化目标,用「关注奖励分布左尾」替代「追求整体均值」,在多领域数据集上表现超越 GRPO 等。

机器之心
产品应用8

只用国产GPU训练的大模型性能飙升100%!国内唯一,更懂你

科大讯飞发布全国产算力训练的讯飞星火X1.5,推理效率暴涨100%,综合性能跻身全球顶级。还首发非自回归语音大模型架构,效果提升、成本降低。此外,展示多领域应用成果,发布相关产品,开源智能体平台。

新智元
算法论文8

ICCV 2025|降低扩散模型中的时空冗余,上交大EEdit实现免训练图像编辑加速

上海交通大学EPIC Lab团队提出EEdit框架,入选ICCV 2025。它是首个加速匹配流模型图像编辑框架,能兼容多种引导方案,免训练,速度较原始工作流快2.4倍,支持多类型编辑任务。

机器之心
开源动态8

Transformers来到了v5时代:从工具包到真理之源,AI时代的操作系统内核的极简进化论

Transformers v5发布,通过极简定义和极致互通成AI生态核心。它做减法重构代码、拓展训练流程、成推理引擎弹药库、提升量化为核心功能,连接训练推理与部署,是AI生态通用语言。

AIGC开放社区
算法论文8

DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍

扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。

机器之心
算法论文8

腾讯提出Vision-SR1:让模型真正学会“看图思考”,而不是“蒙答案”

视觉语言模型(VLMs)存在视觉幻觉和语言捷径问题,限制其可靠性和泛化能力。腾讯提出Vision - SR1训练方法,通过推理分解和自我奖励机制,不依赖外部监督,提升模型视觉感知和推理可靠性。

深度学习自然语言处理
开源动态8

无需训练,即插即用:西湖大学发布世界模型WorldForge,让普通视频模型秒变「世界引擎」

自Sora亮相,AI视频可控性成瓶颈。西湖大学AGI实验室团队提出WorldForge框架,在推理时为视频模型注入「时空几何」,无需训练,实现单图360°环绕视频生成和视频重运镜等,降低创作门槛。

机器之心
算法论文8

10步优化超越强化学习,仅需1条未标注数据!后训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。

新智元
开源动态8

突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度

在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。

量子位
开源动态8

阿里云通义点金发布DianJin-R1金融领域推理大模型,32B模型荣膺榜首

阿里云通义点金团队与苏州大学合作推出DianJin-R1金融领域推理大模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。

机器之心