中训练」共找到 4199 篇相关文章

算法论文8

GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026

本文聚焦基于模型的离线强化学习,指出RAMBO算法存在保守性难控和训练不稳问题。为此提出ROMI方法,引入鲁棒价值感知框架与隐式可微自适应加权机制,在多基准任务上超越基线算法。

AI科技评论
产品应用8

蚂蚁集团扩散大语言模型新突破:超800Token/s,速度与质量兼得

蚂蚁集团将LLaDA更新到2.1,通过引入“草稿 - 编辑”机制,打破扩散模型推理速度与质量的对立僵局。它有极速和质量两种模式,还采用混合训练流程及强化学习,在多基准测试表现出色。

AIGC开放社区
开源动态8

杨植麟亲自发布,月之暗面最强模型Kimi K2.5开源

杨植麟发布月之暗面最强模型Kimi K2.5,经约15万亿视觉与文本混合数据预训练,有顶尖编程与视觉能力及智能体蜂群范式。在多基准测试表现优,成本低于对手,还能提升办公生产力。

AIGC开放社区
新闻资讯8

Cursor终结者?Grok 4正式登顶!马斯克扬言编程碾压,20万N卡年赚47亿美金!

时隔5个月,xAI发布通用模型Grok 4,后续还将推三款模型。Grok 4上线,有三个订阅版本。马斯克称其智能超博士生,多项基准测试领先,编码或超Cursor。其性能强大源于训练投入和计算扩展。

AI前线
算法论文8

伯克利斯坦福联手造出「科研预言家」:77%准确率押注研究想法前景

伯克利和斯坦福团队让GPT - 4.1变身「科研预言家」,从顶会提取想法对比案例训练,不借助实验验证,靠推理押注。其在公开题库测试、人类专家团战等测试表现出色,还能预测AI新点子。

深度学习自然语言处理
新闻资讯7

北大卢宗青:现阶段世界模型和 VLA 都不触及本质|具身先锋十人谈

北大卢宗青作为具身大脑创业者,认为现阶段世界模型和 VLA 未触及本质。他指出互联网视频数据是唯一可规模化的道路,其创立的「智在无界」正标注互联网视频人类关节动作让模型学习。

AI科技评论
算法论文8

PITT | 提出PhyT2V框架:让文生视频(T2V)更符合物理规律(CVPR2025)

当前T2V技术迈向推理驱动阶段,物理规律是关键约束。匹兹堡大学团队提出PhyT2V框架,不依赖模型重训练或大规模外部数据,可增强主流T2V模型能力,有低落地门槛和良好泛化性。

AINLPer
开源动态8

Ψ₀刚刚开源了!迈向通用人形机器人的基座模型

南加州大学团队开源迈向通用人形机器人的基座模型Ψ₀,仅需80条真机遥操作数据,在总体任务成功率和子任务指标上平均领先NVIDIA最新开源模型GR00T N1.6超40%,还介绍了其数据、训练、架构等方面。

机器之心
开源动态8

英伟达韩松团队新作:具有后神经架构搜索的高效语言模型

英伟达韩松团队推出基于后神经架构搜索的高效语言模型Jet - Nemotron,在基准测试表现出色,准确率与Qwen3等相当甚至更优,生成吞吐量大幅加速。模型构建经多步骤优化,代码和预训练模型将开源。

量子位
推荐文章8

指导Harness的越多,收益反而越差

Thinking Machines Lab的《Interaction Models》指出,当下产品形态,指导harness越多收益越差。问题在协作带宽,提出把“会交互”练进模型本体,介绍了从零训练的interaction model及架构,还指出现有交互评测不足。

CourseAI