「高质量数据」共找到 4290 篇相关文章
独家解读|2025年AI五大趋势与底层数据革命
2025 年 AI 发展重心转移,高质量数据成新基石。本文解读五大技术趋势,如多语种 TTS 与全双工交互、多模态大模型等,还介绍了各趋势的数据需求及数据堂提供的相应数据服务方案。
数据合成有没有未来?事实结论来了
有人认为用大模型合成数据可快速生产,无需人工标注。但作者观察发现人工标注不仅必要且要求更高。以Scale AI、Surge AI为例说明标注价值,还展示‘智能知识’团队对两数据集审查结果,证明高质量数据需专家和管理流程。
从 AI 招聘到数据标注,Mercor 能否打造下一个 Scale AI?
Mercor 从 AI 招聘平台转型为数据标注服务提供商,与 Scale AI 竞争。它利用早期人才招聘积累,为小规模、高难度项目提供灵活方案,虽数据质量待提升,但增长快,2025 年初 ARR 达 7500 万美元,获 1 亿美元 B 轮融资。
史上最大高质量科学推理后训练数据集开源,快速让Qwen3等变“科学家”
上海创智学院、上海交通大学发布开源科学推理后训练数据集MegaScience,含约125万条问答对,覆盖多学科。它解决了现有数据集的问题,实验显示能提升模型科学推理能力,已完整开源相关组件。
ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集
来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。
告别先开发后治理:Agent 驱动的数据质量一体化交付
文章指出离线数据开发中数据质量建设面临开发与治理分离的困境,如治理滞后、迭代不同步等。DataWorks引入Data Contracts理念,以YAML Spec形式将质量规则嵌入开发流程,还可借助Agent配置规则,未来将多引擎覆盖、降低门槛并融入IDE。
博士答辩PPT分享 | 高雷诺数湍流场数据同化与湍流模型机器学习研究
西北工业大学孙旭翔博士的论文聚焦航空航天湍流模拟难题,结合数据驱动与同化方法,构建全流程框架,提出数据同化与模型修正方法,设计集成框架,实现高雷诺数复杂流动精确高效模拟。
斯坦福与Adobe新研究,模仿蒸馏技术轻松让200亿参数图像生成高质量大模型
斯坦福大学和Adobe研究院联手,用pi - Flow技术让200亿参数文本到图像大模型4步内生成高质量、高多样性图片。此前少步生成有质量和多样性问题,他们推出GMFlow和pi - Flow解决难题,LakonLab是其背后工程支撑。
数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手
文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。
面向 AI Agents 的高性能数据基座:架构和工程实践
在 QCon 全球软件开发大会上,晨章数据创始人陈亮分享了面向 AI Agents 的高性能数据基座。他指出 AI Agent 驱动的应用带来数据挑战,提出多模态数据基座设计目标,并介绍工程实践,证明传统架构有 CPU 瓶颈。