「数据治理」共找到 2578 篇相关文章
小米模型实现声音理解新SOTA!数据吞吐效率暴增20倍,推理速度快4倍 | 全量开源
小米全量开源MiDashengLM - 7B模型,它基于Xiaomi Dasheng和Qwen2.5 - Omni - 7B Thinker,实现声音理解新SOTA。性能领先,推理效率高,革新训练范式,全栈开源,将赋能多场景。
AI出码率70%+的背后:高德团队如何实现AI研发效率的量化与优化
文章围绕建立统一数据采集和指标体系,搭建AI统一数据采集能力,定义AI出码率等核心指标,构建AI效率研发指标体系,还介绍了数据采集方案、指标计算等,实现数据驱动闭环。
别装了,AI巨头们!谁在卡脖子,谁在割韭菜?这张图一目了然
卡内基梅隆大学发布首个刻画AI供应链数据集,揭示资本、科技与权力「关系网」。供应链上游市场集中或致连锁故障与垄断,绘制其链条能助于多项关键分析,看清产业全貌。
仅有一位作者的论文,却补上了城市智能的「最后一公里」
郑宇教授用论文提出跨域多模态知识融合框架,在空气质量推断等多场景优势明显,其研究按数据选择等四阶段进行,解决数据难题,推动AI用于城市问题,为跨部门协作提供可能。
当200位具身从业者被拉进同一个屋子
量子位等联合发起沙龙,近200位具身从业者探讨具身智能从实验室走进物理世界的问题。乐聚工程师指出具身数据瓶颈,蚂蚁灵波郑可成介绍模型,上海交大李永露分享评测基准,圆桌对话探讨数据挑战与破局路径。
Data Agent如何帮助企业打造懂你的“电子牛马”?|数势xSelectDB
本文邀请数势科技谭李和飞轮科技肖康探讨数据Agent。谈到懂业务的Agent特点、与传统BI差异,还提及数据库挑战及应用场景,指出Agent能激活数据、提升交互效率,未来将催生新角色。
告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级大模型
麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。
VLA不够了?触觉,将改写具身智能新格局
2026 年数据成具身智能竞赛焦点,IEEE 专访机器人学家王煜。他认为 VLA 架构难支撑机器人落地,触觉数据是关键。他与团队提出 VTLA 框架,创立戴盟机器人,发布数据集并开源部分数据,还阐释对具身智能多方面的思考。
苹果ASM投放的两种方式,竞价原理与机制
苹果ASM投放模式的选择对广告效果至关重要。Basic模式适合预算有限且缺乏投放经验的开发者,操作简单但数据报告不详尽。Advanced模式则适合专业团队,提供更精准的用户定位和详尽的数据报告,以便随时调整广告策略。
开源多模态推理「破壁」时刻:MMFineReason助力4B逆袭30B
长期以来,开源多模态模型在复杂推理任务上与顶尖闭源模型有差距,核心痛点是高质量推理数据匮乏。上海AI实验室OpenDataLab团队开源MMFineReason框架及大规模数据集,小模型凭此实现性能逆袭。