「数据验数」共找到 2787 篇相关文章
ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集
来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。
上交、清华、微软、上海AI Lab等联合发布数据分析智能体综述,LLM化身数据分析师,让数据自己「说话」
传统数据分析方法耦合度高、扩展性差,大语言模型与智能体让数据分析迈向“语义理解”。上交、清华等机构联合撰写综述,回顾演进,提出新范式,总结关键技术、趋势及挑战,推动通用数据分析智能体发展。
博士答辩PPT分享 | 高雷诺数湍流场数据同化与湍流模型机器学习研究
西北工业大学孙旭翔博士的论文聚焦航空航天湍流模拟难题,结合数据驱动与同化方法,构建全流程框架,提出数据同化与模型修正方法,设计集成框架,实现高雷诺数复杂流动精确高效模拟。
数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手
文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。
英伟达揭示RL Scaling魔力!训练步数翻倍=推理能力质变,小模型突破推理极限
学界对强化学习能否让模型学会新推理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型训练数据中过度呈现及训练步数不足。其ProRL框架提升训练步数,释放小模型潜力,还构建技术组合拳。
关于机器人数据,强化学习大佬Sergey Levine刚刚写了篇好文章
训练大模型难度随规模和应用拓展而增加,所需数据海量。机器人领域获取训练数据成本高,研究者尝试找替代方案。强化学习大牛Sergey Levine分析数据组合,认为鱼和熊掌不可兼得,替代数据有局限。
75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据
Google DeepMind团队开发的DataRater可全自动评估数据质量,用元学习筛选有价值数据,提升模型训练效率。它能减少计算量、提高性能,在低质量数据集效果佳,还能跨模型规模泛化。
Agent时代,为什么多模态数据湖是必选项?
AI时代,数智化底层是基建深耕。企业要构建多模态数据湖,因其能处理多模态数据,唤醒沉睡数据,驱动业务,还提供工程确定性。火山引擎给出升级路线及选型指南,其多模态数据湖已在多行业落地。
揭秘 Uber 跨区域数据湖与灾难恢复机制:350PB 数据、数百万事件、单一系统
Uber构建的HiveSync是分片式批量复制系统,能让Hive和HDFS数据跨区域同步,每天处理数百万Hive事件。它基于Airbnb ReAir扩展,分离控制与数据平面,有复制和数据修复两组件,未来计划拓展到云端。
终结数据荒!智源开源首个Deep Research数据合成框架InfoSeek
在大模型深度研究中,高质量数据是短板。近日,智源研究院发布首个面向深度研究的开源数据集InfoSeek,提出「扩散 - 回溯」数据合成方法,用3B模型在基准测试中接近商业模型表现,且数据集可扩容。