「训练数据」共找到 3893 篇相关文章
手术刀式去噪突破LLM能力上限,从头预训练模型下游任务平均提高7.2% | 中科院&阿里
中科院计算所与阿里Qwen等团队联合提出RefineX框架,通过程序化编辑任务实现预训练数据精炼。它将专家指导结果蒸馏为删除程序,训练优化模型。用其净化数据训练模型,下游任务平均提高7.2%。
超越人类标注,Meta提出CoT-Self-Instruct:如何用"推理式自进化"重塑LLM训练
大语言模型发展需海量高质量训练数据,传统人工标注困境重重,现有合成数据方法也有缺陷。Meta提出CoT - Self - Instruct,通过推理式自进化生成数据,实验证明其在多个任务上超越人类标注数据。
对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」
本文是对际数科技三位联合创始人的访谈。在具身智能时代数据采集火热但数据荒严重背景下,际数关注数据质量,其以测绘背景为底气,用‘一张图、一把尺、一个飞轮’搭建技术护城河,打造质量因子库,还创新训练质量模型,有稳定商业路径。
终结数据荒!智源开源首个Deep Research数据合成框架InfoSeek
在大模型深度研究中,高质量数据是短板。近日,智源研究院发布首个面向深度研究的开源数据集InfoSeek,提出「扩散 - 回溯」数据合成方法,用3B模型在基准测试中接近商业模型表现,且数据集可扩容。
0 融资、10 亿美元营收,数据标注领域真正的巨头,不认为合成数据是未来
Surge AI创始人Edwin Chen接受访谈,提出创业应解决问题而非融资,合成数据被高估,高质量数据才是壁垒。他还指出大语言模型竞技场误导训练方向,人类反馈永不过时,数据质量是AI发展首要瓶颈。
从 “管好数据” 到 “让数据生智”,华为再发新作《数据空间探索与实践》| 文末赠书
2025年11月15日,机械工业出版社牵头举办研讨会,庆祝《华为数据之道》发行五周年及《数据空间探索与实践》上市。行业大咖齐聚,共话数据治理演进,两书为行业提供了有价值的参考。
80万条数据揭示隐患:AI正在「污染」病历,你的诊疗数据可能越来越不靠谱
新加坡国立大学等机构团队研究显示,AI生成临床文本用于训练新模型,会使病理信息在数据迭代中消失,降低医疗AI诊断可靠性。研究分析80多万条合成数据,还提出缓解方法。
清华&通院推出"绝对零"训练法,零外部数据大模型自我博弈解锁推理能力
清华、北通院和宾州州立大学研究人员提出“绝对零”训练法,让大模型通过自我博弈生成并解决任务获推理能力。测试显示,其训练出的模型超专家标注样本训练的模型,且能提升编程与数学推理表现。
Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签
在计算机视觉领域,获取带标签数据成本高、耗时长。开源项目 lightly-train 用未标记图像和视频自监督预训练,减少标注成本与时间,可集成到现有训练管道,支持多种模型架构和应用场景。
最大开源第一视角数据集 EgoLive 来了,名校站台、近百家机构争相申请
今年4月京东开源业界最大人类第一视角数据集EgoLive,已获近百家机构申请。它用自研设备采集,经多模态处理,覆盖多场景任务。其数据用于JoyAI - RA训练,在真实场景验证效果好,还推动具身智能数据标准化。