「数据语义」共找到 2602 篇相关文章
全球首家具身数据独角兽诞生:光轮智能完成10亿元融资,开启具身数据规模化元年|甲子光年
具身智能进入数据Scaling Law时代,光轮智能完成10亿融资成全球首家具身数据独角兽。它构建了World-Behavior-Eval数据引擎体系,在多领域获国际交付冠军,客户涵盖顶尖企业,正构建物理AI时代基础设施。
调整训练数据出场顺序,大模型就能变聪明!无需扩大模型/数据规模
微软亚洲研究院提出全新文本数据组织范式DELT,通过引入数据排序策略,充分挖掘训练数据潜力,优化训练数据的组织方式,在不同模型尺寸与规模下都达到了良好性能,且不用增加数据量或扩大模型规模。
10%训练数据超越100%表现,机器人学习领域迎来重要突破
密歇根大学和瑞典皇家理工学院团队提出 ViSA - Flow 框架,能从人类视频提取语义动作流,提升机器人数据稀缺时学习效率。在 CALVIN 测试中,用 10% 训练数据超越 100% 数据方法,有技术优势也存在局限。
阿里巴巴 & 蚂蚁 LoongSuite GenAI 可观测语义规范:从统一数据语言到规模化落地
随着GenAI发展,OpenTelemetry推动语义规范建设。阿里巴巴与蚂蚁联合推出LoongSuite GenAI SemConv,在OTel基础上增强,新增Entry/Step Span、Skill语义、Token级推理观测,还推出GenAI Utils简化插桩开发。
让AI自己“炼数据”!DataChef开源:用强化学习自动生成LLM数据配方
上海人工智能实验室联合复旦大学开源DataChef,它能通过在线强化学习自动生成LLM数据配方。实验显示其能力逼近Gemini - 3 - Pro,超越人类专家设计算法,解决传统数据工程难题,推动大模型数据工程迈向新范式。
给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型
文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。
刷榜自动驾驶语义场景补全!北大新作:高维度、高密度 | AAAI'26
北京大学彭宇新教授团队提出视觉语义场景补全方法HD² - SSC,通过高维度语义解耦和高密度占用优化,解决现有技术维度与密度差异问题,在两自动驾驶数据集上取得最优性能。
Data Agent 落地挑战:忽略技术框架、语义能力和运营体系,投入可能打水漂
Data Agent 看似易上手,落地却充满挑战。腾讯数据工程专家虎兴龙指出,90% 难点源于软件工程,统一语义层建设是关键。企业若忽略相关要点,投入或打水漂,掌握关键要素可提升数据智能化效率。
ICML spotlight | 一种会「进化」的合成数据!无需上传隐私,也能生成高质量垂域数据
大模型发展使数据短缺问题加剧,特殊领域更严重。为此提出合成数据自主进化框架PCEvolve,只需少量标注样本,就能在保护隐私同时进化出数据集,还介绍了其架构、选择器设计及实验结果。
统计可控数据合成!新框架突破大模型数据生成局限,麦吉尔大学团队推出LLMSynthor
麦吉尔大学团队提出新方法LLMSynthor,让大模型成结构感知的数据模拟器,为隐私敏感、数据稀缺场景生成不泄密的高质量替代数据。它通过结构推理、统计对齐等步骤实现,有理论保障,多场景实测效果佳。