「数据索引能力」共找到 5166 篇相关文章
独家丨智驾老将佟显乔再创业,聚焦机器人数据方向
AI科技评论独家获悉,前卡睿智行创始人佟显乔2025年5月创立深圳极数迭代科技有限公司,聚焦机器人数据。该公司另一股东关联港中深,这是佟显乔与港中深在该领域的深度合作。
庞若鸣还有苹果论文?改善预训练高质量数据枯竭困境
苹果基础模型原负责人庞若鸣在 Meta 任职期间,其在苹果参与的高价值研究仍不断发表。研究团队针对大模型训练中高质量数据枯竭问题,提出 Synthetic Bootstrapped Pretraining (SBP) 预训练流程,提升模型性能。
震撼发布!最大人体动作数据集 MotionMillion 正式登场
上海交通大学研究团队构建高效标注流程,发布最大人体动作数据集MotionMillion,含超2000小时、200万条文本 - 动作配对数据。还推出评测体系MotionMillion - Eval,训练70亿参数动作生成大模型,刷新SOTA。
ICML 2025 | 如何在合成文本数据时避免模型崩溃?
随着生成式AI发展,合成数据成大模型训练重要部分,但可能引发“模型崩溃”。ICML 2025会议上,上交大等团队剖析此问题,提出Token - Level Editing策略,避免模型崩溃,实验验证了其有效性。
Nature警告:AI「数据饥渴症」引爆学术宕机潮!90%知识库濒临崩盘
Nature揭露AI爬虫疯狂「啃食」学术网站数据,致服务器瘫痪。DiscoverLife、BMJ等受影响,运营方难防「坏爬虫」,急需国际协议规范AI数据使用。
好奇心之旅:Cursor代码库索引机制的学习笔记
作者作为高德信息工程团队AI先锋队一员,日常用Cursor开发,因好奇其代码库索引机制展开探索。介绍了Cursor索引工作流程、隐私安全等,还研究Merkle树、turbopuffer向量库及开源方案Continue。
从 SQL 到自然语言,下一代 Lakehouse 为何必须「AI 优先」
随着大模型技术爆发,数据分析范式重构,未来数据多模态、分析复杂、查询方式转变。文章指出构建下一代 AI-First Lakehouse,要在存储计算、内核能力、架构适配、平台自治等方面升级,打破数据壁垒。
数据蒸馏的双重突破:从几何保真到对抗鲁棒
深度学习中,数据集蒸馏可用精简合成样本替代庞大训练集且不牺牲模型性能,但面临精度和可靠性两大难题。两篇发表于 ICCV 2025 和 AAAI 2025 的论文分别给出解决方案,且代码已开源。
Meta提出数据筛选的理论:何时“少即是多”成立?
Meta针对机器学习领域‘少即是多’悖论提出理论框架,用高维统计等方法推导测试误差缩放定律,揭示数据筛选‘相变’条件,为实践提供指导,还重新定义‘数据效率’意义。
为什么我觉得AGI并不会马上到来
作者Dwarkesh Patel认为AGI不会马上到来。当前大语言模型缺乏持续学习能力,难以替代人类工作;计算机操作能力受训练周期、数据等限制;推理能力虽有突破,但仍需时间发展。作者给出了具体预测时间。