数据价值验证」共找到 3639 篇相关文章

算法论文7

表格建模也能Scaling?树模型的时代要改变了

文章指出 AI 算力增长与结构化数据建模以树模型为主形成反差。浙大 X 蚂蚁 AIforData 团队探索结构化数据预训练,在表格数据和行为序列预训练上有成果,验证了 Scaling Law,预示结构化数据建模范式将改变。

机器之心
算法论文8

10%训练数据超越100%表现,机器人学习领域迎来重要突破

密歇根大学和瑞典皇家理工学院团队提出 ViSA - Flow 框架,能从人类视频提取语义动作流,提升机器人数据稀缺时学习效率。在 CALVIN 测试中,用 10% 训练数据超越 100% 数据方法,有技术优势也存在局限。

机器之心
开源动态8

不用上传数据了!苹果正式开源 Embedding Atlas,用 Rust+WebGPU 在桌面实现科研级数据分析

苹果发布开源工具 Embedding Atlas,支持对大规模嵌入向量交互式可视化与探索。它在浏览器端运行,保障数据隐私,有多种可视化功能,提供 Python 包和 npm 库,已在 GitHub 开源。

InfoQ
产品应用8

Uber Hive 联邦架构:1.6 万数据集、10PB 数据去中心化,支撑大规模分析零停机

Uber重新设计Hive数据仓库,将超16000个数据集、超10PB数据去中心化部署,解决可扩展性等挑战。采用基于指针方案迁移,系统含四大组件降低运营风险,还减少存储开销,提升生态弹性。

InfoQ
算法论文8

1052篇文献!上海AI Lab发布科学LLM综述:从数据基础到Agent前沿

上海AI Lab主导,25家研究机构共同梳理270+训练集、190+评测集,提出科学数据分层框架与智能体闭环科研新范式。还介绍了模型演进、数据情况、评估基准等,指出数据缺陷并展望走向科学家智能体的三步。

PaperAgent
算法论文8

NIPS 2025 Spotlight | 港大提出TreeSynth方法,一句话生成百万规模数据

港大团队提出TreeSynth方法,受决策树启发,将数据合成问题映射到其空间分割机制。它采用两阶段流程,能从零合成数据,还可优化现有数据集。实验显示其在多基准任务上性能提升显著,可扩展性佳。

机器之心
开源动态8

中国具身模型狂揽全球第一!机器人的人类数据时代来了

00后带队的灵初智能用近10万小时人类数据拆解具身智能,1000小时数据开源。其发布Psi-R2和Psi-W0双系统架构,让Psi-R2登顶MolmoSpace榜单。灵初认为纯人类数据训练必要,还强调开源对具身智能落地重要。

量子位
开源动态8

750城市+5000小时第一人称视频,上海AI Lab开源面向世界探索高质量视频数据

上海人工智能实验室等机构联合推出持续迭代的高质量视频数据集项目Sekai,含Sekai-Real和Sekai-Game两个数据集,还训练了模型Yume。它特点突出,团队按四环节构建,望成世界建模等领域的数据基石。

量子位
产品应用7

Git for Data: 像 Git 一样管理你的数据

传统数据恢复手段在AI时代耗时费力,Git for Data带来变革,具备版本控制、快速回滚等能力,是AI时代数据管理新范式。MatrixOne数据库已具备其核心能力,未来将持续增强相关特性。

InfoQ
开源动态8

开源1万小时具身智能数据,这家公司是为了什么?

为加速具身智能发展,开源数据成行业选择。1 月 6 日,简智机器人开放超 1 万小时、近百万 clips 的“10Kh RealOmni - Open DataSet”,规模大、质量高、泛化强,还介绍了其数据生产链条。

机器之心