「低保真数据」共找到 3321 篇相关文章
打破资源瓶颈!华南理工&北航等推出SEA框架:低资源下实现超强多模态安全对齐
本文介绍北航彭浩团队的 SEA 框架,针对多模态大模型低资源安全对齐难题,用合成嵌入替代真实数据,突破资源瓶颈。还构建 VA - SafetyBench 评估安全风险,实验验证了 SEA 低资源、高泛化优势。
数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手
文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。
地瓜机器人携手虚时科技,补上具身智能的仿真数据“黑洞”|甲子光年
5月12日,虚时科技与地瓜机器人联合开发的AnySceneGen平台发布,这是面向具身智能训练的仿真空间生成平台。具身智能训练需海量数据,传统仿真数据生产依赖人工,效率低。该平台以模型替代人工,重构生产方式,优势显著。
华为中科大联创大模型低比特量化算法,1‰数据实现昇腾无损压缩7倍
华为诺亚方舟实验室联合中科大提出CBQ后训练量化方案,仅用0.1%训练数据实现大模型7倍压缩,保留99%精度。该成果登ICLR 2025 Spotlight,已加入昇腾ModelSlim工具包。
RAG新SOTA,还在5亿条数据上跑进秒级,只有它了
本文围绕RAG技术展开,指出传统RAG在多跳推理等方面存在局限。介绍了GraphRAG、HippoRAG 2的优缺点,重点阐述Zleap AI的SAG方案,它用超边结构重构数据底座,在多跳问答测试中表现出色,还能在大规模数据下低延迟落地。
75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据
Google DeepMind团队开发的DataRater可全自动评估数据质量,用元学习筛选有价值数据,提升模型训练效率。它能减少计算量、提高性能,在低质量数据集效果佳,还能跨模型规模泛化。
揭秘 Uber 跨区域数据湖与灾难恢复机制:350PB 数据、数百万事件、单一系统
Uber构建的HiveSync是分片式批量复制系统,能让Hive和HDFS数据跨区域同步,每天处理数百万Hive事件。它基于Airbnb ReAir扩展,分离控制与数据平面,有复制和数据修复两组件,未来计划拓展到云端。
终结数据荒!智源开源首个Deep Research数据合成框架InfoSeek
在大模型深度研究中,高质量数据是短板。近日,智源研究院发布首个面向深度研究的开源数据集InfoSeek,提出「扩散 - 回溯」数据合成方法,用3B模型在基准测试中接近商业模型表现,且数据集可扩容。
AI「偷学」你的数据?6大顶级机构联手提出数据保护4大分级体系
生成式AI普及,数据保护成挑战。来自多机构研究者发布论文,提出全新数据保护分级体系,分为数据不可用、隐私保护、可溯源、可删除四级,还探讨了技术、法规及面临的挑战。
0 融资、10 亿美元营收,数据标注领域真正的巨头,不认为合成数据是未来
Surge AI创始人Edwin Chen接受访谈,提出创业应解决问题而非融资,合成数据被高估,高质量数据才是壁垒。他还指出大语言模型竞技场误导训练方向,人类反馈永不过时,数据质量是AI发展首要瓶颈。