「数据重构」共找到 3334 篇相关文章
具身智能的无本体数据,终于有了自己的「代表作」
自变量机器人发布的Demo中,机器人用数百条无本体数据完成化学实验。其发布的TwinDEX系统由无本体数据采集系统和机器人末端执行器组成,能让无本体数据获接近真机数据的训练效果,重新定义数据采集逻辑。
数据困局下的具身智能,谁能率先破局?
具身智能面临数据困局,Skild AI 关注真实数据不足难题。学者 Levine 称只有真实数据能达通用具身智能,而王鹤认为合成数据可助具身智能冷启动和规模化发展。遥操作和 Sim2Real 是不同技术路线。
地平线首曝BPU「黎曼」架构,用数学流形重构AI计算
2025 年 12 月 8 日深圳举办的地平线技术生态大会上,地平线首曝 BPU「黎曼」架构,用数学流形重构 AI 计算。还发布第四代编译器,推出 HSD Together 模式,开源具身智能模型,欲构建物理 AI 世界底层生态。
Pinterest 利用内容指纹技术,在数百万个域名中实现 URL 去重
Pinterest工程师开发“最小重要查询参数集”(MIQPS)URL标准化系统,用于优化大规模数据采集管道内容去重。它取代传统方法,用数据驱动判断参数重要性,还采用早期退出逻辑等提高效率。
LinkedIn 重构服务发现:在大规模环境中用 Kafka 和 xDS 取代 Zookeeper
LinkedIn 工程博客中,Bohan Yang 介绍升级基于 ZooKeeper 的传统服务发现平台项目。因传统系统有扩展性问题,团队开发新架构,分离读写路径,实施双读双写机制,迁移后数据传播延迟显著改善。
改写纳米光学底层逻辑!MIT学者搭建通用可重构光子平台
MIT助理教授唐皓凝构建可相对运动的双层纳米光子系统,将机械运动变为可定量科学变量。2024年,她和合作者集成光谱仪和偏振仪功能。她想发展可编程光子架构,还把AI作工具。
一副手套,干翻硅谷炫技派!中国队杀入战场,狂卷100万小时数据
硅谷具身智能玩家为数据发愁,中国灵初智能另辟蹊径,用数据手套采集工人操作数据,成本低且数据泛化性强。其专注物流细分场景,2026年收敛资源做深现有场景,目标推100万小时数据训练模型。
全国首部“高质量数据集验收”标准,现公开征集起草单位和专家!
国家数据局等明确支持数据流通服务机构与人工智能企业合作,凸显数据到模型训练与产业应用环节的重要性。现有数据质量标准在产业场景有缺口,全国首部《人工智能训练数据集交付与质量验收规范》团体标准应运而生,现征集起草单位和专家。
蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据
蚂蚁集团论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获VLDB工业赛道最佳论文。其研发的OmniTable系统能管理超35PB、3050亿条以上训练数据,解决数据准备难题,如在SFT任务中大幅缩短周期。
Qoder 发布首个自进化的智能体:看 Quest 如何重构了 Quest
Qoder 发布首个自进化智能体 Quest,它能自主完成重构自身长程任务执行逻辑等任务。Quest 从上下文管理、工具选择、Agent Loop 三方面优化架构,还具备自主进化能力,正探索自主编程新可能。