「预训练数据精炼」共找到 3915 篇相关文章
致敬Kimi K2:基于slime的全流程INT4量化感知RL训练
受Kimi K2团队启发,SGLang RL团队落地INT4量化感知训练流程方案,在强化学习多方面取得进展,还在slime框架复现全流程方案,实现媲美BF16精度,提高Rollout效率,为社区提供开源参考。
RAE+VAE? 预训练表征助力扩散模型Tokenizer,加速像素压缩到语义提取
近期,RAE 提出以「 冻结的预训练视觉表征」作潜空间提升扩散模型性能。同期西安交大与微软亚研院提出 VFM - VAE,结合 RAE 与 VAE,能加速模型收敛、提升生成质量,展示扩散模型 Tokenizer 演化方向。
AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用
深势科技推出玻尔·跃迁实验室,解决传统实验室设备割裂、经验依赖、数据离散、部署低效等痛点,围绕计算 - 实验 - 数据 - 计算无缝闭环底层重构,与传统 ELN/LIMS 不同。
从单领域到多能力协同:数据混合如何重塑AI的强化学习
上海AI Lab的OpenDataLab团队通过大规模实验剖析可验证强化学习(RLVR)在多领域推理中的机制,发现逻辑与数学数据相互支持、代码推理有跨领域混合效应等,为构建AI推理模型提供关键发现。
类R1训练不再只看结果对错!港中文推出SophiaVL-R1模型
DeepSeek - R1爆火后,类R1结果奖励训练范式引发推理热潮,但仅以结果对错奖励模型有弊端。港中文联合团队发布多模态推理模型SophiaVL - R1,引入‘思考奖励’机制,还用Trust - GRPO算法解决奖励欺骗问题。
LLM 仅靠自身就能增强推理?SePT 给出简洁在线自训练范式
多数推理后训练方法依赖外部信号,SePT仅用模型自身生成的答案自训练,能提升推理能力,数学推理任务准确率升10个点。它核心简洁,设计关键是温度解耦等,不损模型通用能力,代码易迁移复现。
第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力
新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型。
Transformer死角,只需500步后训练,循环模型突破256k长度泛化极限
线性循环模型能处理极长序列,是相比Transformer的关键优势,但过去循环模型性能不足且难以泛化。CMU等研究者证明,通过简单训练干预,循环模型500步后训练可突破256k长度泛化极限。
智能流体力学专题研讨会特邀报告2|肖恒:turbX——基于多目标学习的通用数据驱动湍流建模
2026年8月,第十四届全国流体力学学术会议在山东青岛举行,智能流体力学专题研讨会展示了人工智能与流体力学交叉研究进展。本次聚焦《turbX:基于多目标学习的通用数据驱动湍流建模》报告,研究来自斯图加特大学相关机构。
EAAI | 香港理工大学王旭等:一种增强MFNN的多源气动数据重构方法
飞行器气动压力分布获取依赖风洞试验或数值模拟,多源数据差异为气动数据重构带来挑战。本研究提出增强型多保真神经网络,通过差分运算提升模型泛化精度,在跨声速压力分布重构中效果显著。