「高质量数据」共找到 4298 篇相关文章
超越VLA与世界模型,银河通用发布LDA,全谱系数据跑通Scaling Law
近期具身智能领域竞争激烈,银河通用联合多机构发布 LDA-1B 模型,能统一利用各类具身数据。它在基准测试中表现出色,代码已开源,还解决了数据格式、质量等问题,实战效果也很突出。
华人团队终结Token危机:扩散模型数据潜力超自回归三倍
最新研究发现,token数量受限下,扩散语言模型数据潜力超自回归模型三倍多。一个1B参数的扩散模型用1B tokens训练,在基准测试取得不错准确率,且未现性能饱和。
隐私优先的本地匿名化小模型:在数据离开设备前保护个人信息
最强 AI 模型在云端,安全数据在本地,这一矛盾困扰着想用 AI 处理敏感信息的人。Freysa 团队提出解法,不重写提示,只替换敏感信息,用小模型实现精准匿名化,有实用价值。
小米模型实现声音理解新SOTA!数据吞吐效率暴增20倍,推理速度快4倍 | 全量开源
小米全量开源MiDashengLM - 7B模型,它基于Xiaomi Dasheng和Qwen2.5 - Omni - 7B Thinker,实现声音理解新SOTA。性能领先,推理效率高,革新训练范式,全栈开源,将赋能多场景。
数据分析师,即将从工业领域“消失”?
2023年底Google裁撤数据科学家引发关注,AI+BI普及使岗位裁撤风潮蔓延至工业领域。2025年7月TDengine发布TDengine IDMP,主打“无问智推”,有望带来数据消费范式革命,加速工业智能化转型。
字节Seed新方法!开源8B代码模型:自己筛数据训练自己,同量级SoTA,还能超越百亿级对手
传统code大模型依赖人工筛选数据,成本高、效率低。而Seed - Coder团队让LLM自己筛选数据训练自己,打造8B参数轻量级开源代码模型,性能超百亿级对手,不过也存在通用和数学能力短板。
又一家清华系具身智能企业浮出水面:天使轮融资数千万元,打造具身数据Infra丨甲子光年
清华系具身智能企业灵御智能完成数千万元天使轮融资,累计融资近亿元。其聚焦打造具身数据Infra,研发TeleAvatar和TeleDroid构建数据采集母机,锁定三类应用场景,还从两方面压缩成本。
The Batch: 968 | Muse Code 想获取你的数据
Meta推出Muse Code编码框架及Muse Spark 1.2模型,有不同输入输出、功能和性能表现。提供不同档位价格,贡献者档位低价但数据用于训练。测试显示其单任务成本低,Meta此举或为获取编码训练数据。
李静海院士团队:未来数据系统的逻辑与架构 | Engineering
本文展望数据科学未来,强调其对AI重要性。探讨科学数据系统挑战,提出收集处理原则,指出要重视数据系统逻辑与架构研究,建立标准协议框架,促进AI健康发展。
GAIR 2025 「数据&一脑多形」分论坛,激辩 AI 演进路径
在 12 月 13 日 GAIR 大会“数据&一脑多形”分论坛上,探讨了数据价值重构与“一脑多形”架构革命。多位嘉宾围绕具身智能数据、“一脑多形”技术展开分享与讨论,为人工智能发展提供新思路。