「跨领域数据」共找到 4129 篇相关文章
80万条数据揭示隐患:AI正在「污染」病历,你的诊疗数据可能越来越不靠谱
新加坡国立大学等机构团队研究显示,AI生成临床文本用于训练新模型,会使病理信息在数据迭代中消失,降低医疗AI诊断可靠性。研究分析80多万条合成数据,还提出缓解方法。
Uber Hive 联邦架构:1.6 万数据集、10PB 数据去中心化,支撑大规模分析零停机
Uber重新设计Hive数据仓库,将超16000个数据集、超10PB数据去中心化部署,解决可扩展性等挑战。采用基于指针方案迁移,系统含四大组件降低运营风险,还减少存储开销,提升生态弹性。
1052篇文献!上海AI Lab发布科学LLM综述:从数据基础到Agent前沿
上海AI Lab主导,25家研究机构共同梳理270+训练集、190+评测集,提出科学数据分层框架与智能体闭环科研新范式。还介绍了模型演进、数据情况、评估基准等,指出数据缺陷并展望走向科学家智能体的三步。
NIPS 2025 Spotlight | 港大提出TreeSynth方法,一句话生成百万规模数据集
港大团队提出TreeSynth方法,受决策树启发,将数据合成问题映射到其空间分割机制。它采用两阶段流程,能从零合成数据,还可优化现有数据集。实验显示其在多基准任务上性能提升显著,可扩展性佳。
中国具身模型狂揽全球第一!机器人的人类数据时代来了
00后带队的灵初智能用近10万小时人类数据拆解具身智能,1000小时数据开源。其发布Psi-R2和Psi-W0双系统架构,让Psi-R2登顶MolmoSpace榜单。灵初认为纯人类数据训练必要,还强调开源对具身智能落地重要。
《中国Data&AI数据基础设施白皮书》——AI创生核心生产力,开启万亿新基建之路 | 甲子光年智库
全球正处地缘政治与AI技术变革中,AI跃升为核心生产力。中国企业面临‘挤压式转型’,传统数据系统难满足需求。数据厂商需构建新一代数据基础设施,技术上‘湖仓一体’与‘AI原生’融合,推动Data&AI一体化。
最大开源第一视角数据集 EgoLive 来了,名校站台、近百家机构争相申请
今年4月京东开源业界最大人类第一视角数据集EgoLive,已获近百家机构申请。它用自研设备采集,经多模态处理,覆盖多场景任务。其数据用于JoyAI - RA训练,在真实场景验证效果好,还推动具身智能数据标准化。
Git for Data: 像 Git 一样管理你的数据
传统数据恢复手段在AI时代耗时费力,Git for Data带来变革,具备版本控制、快速回滚等能力,是AI时代数据管理新范式。MatrixOne数据库已具备其核心能力,未来将持续增强相关特性。
开源1万小时具身智能数据,这家公司是为了什么?
为加速具身智能发展,开源数据成行业选择。1 月 6 日,简智机器人开放超 1 万小时、近百万 clips 的“10Kh RealOmni - Open DataSet”,规模大、质量高、泛化强,还介绍了其数据生产链条。
独家丨智驾老将佟显乔再创业,聚焦机器人数据方向
AI科技评论独家获悉,前卡睿智行创始人佟显乔2025年5月创立深圳极数迭代科技有限公司,聚焦机器人数据。该公司另一股东关联港中深,这是佟显乔与港中深在该领域的深度合作。