「训练数据污染」共找到 3919 篇相关文章
1人顶1个Infra团队!OpenAI前CTO新招,让大模型训练跌成白菜价
大模型训练正从‘作坊炼丹’进化为‘工业微调’。OpenAI前CTO创立的Thinking Machines Lab推出Tinker,潞晨云微调SDK兼容其范式,实现算法设计与基础设施解耦,降低成本,提升人效,适用于多场景。
阿里杀进Agent上下文战场:钉钉聊天、企业文档、工作数据终于要被Agent吃进去了
个人、企业用户苦工作场景「上下文」久矣,Agent常不懂真实业务。阿里千问办公开源的「MyContext」,将分散工作数据加工成Agent可消费的上下文,处理多种难题,还将能力向组织延伸,助力Agent融入工作流。
给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型
文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。
新手必看!强化学习入门指南 | 从RLHF、PPO、GRPO到RLVR,最后到训练推理模型
Unsloth团队发布强化学习教程,从吃豆人谈起,介绍RLHF、PPO、GRPO等概念,分享用GRPO训练推理模型技巧。涵盖强化学习基础知识,还给出Unsloth使用GRPO训练模型方法及奖励函数示例。
Karpathy盛赞,啥都没有的创业公司刚融了1.8亿美元,要用小数据造强智能
AI创业公司Flapping Airplanes几乎无产品、盈利,也不急于商业化,却获1.8亿美元融资及Andrej Karpathy力挺。它专注解决“数据效率”问题,探索新思路,目标是做改变范式的研究。
传统训练效率很低?我们靠 “给模型降噪” 重新审视长上下文建模难题
文章指出长上下文模型处理长文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在长上下文任务中性能媲美GPT - 4o。
最强开源机器人大脑!蚂蚁两万小时真机数据开启物理AI缩放定律
蚂蚁集团开源具身智能基座模型LingBot-VLA,用两万小时真机数据证明机器人学习有缩放定律且未达瓶颈。该模型优势显著,在多平台表现出色,团队还从数据、架构、工程等方面进行优化,并开源代码等加速行业探索。
微软发布GUI Agent新范式!告别传统方式,小参数少数据,7B吊打72B模型
微软发布GUI Agent新范式GUI - Actor,告别传统Agent定位死板、缺乏空间感和兼容性差等问题。它用无坐标交互技术,在测试中表现优异,省数据算力,未来在多领域有应用潜力。
「上下文学习」之后,腾讯混元第二篇公开研究:精准定位RLVR训练崩溃的“罪魁祸首”Token
腾讯混元团队新研究提出异常梯度定位器 GradLoc,可将全局梯度突刺定位到具体异常 token,降低 RLVR 训练观测与分析门槛,助力解决训练不稳定问题,让模型调优更科学。
打通AI4S数据入口:MinerU.Chem让化学文献中的“图片”,从“人类可读”走向“AI可用”
上海人工智能实验室 OpenDataLab 团队发布 MinerU.Chem 技术报告及成果,升级化学文献智能解析能力。它能将化学文献图片转化为 AI 可用数据,解决化学知识机器难用问题,在评测中领先,还将助力 AI4S 发展。