「训练数据合成」共找到 3972 篇相关文章
Soul App 又放大招!把 42000 小时数据喂出的“歌神” SoulX-Singer 开源了!
语音合成近年爆发式增长,开源领域也有强大音乐模型。Soul APP联合多机构开源的SoulX - Singer,喂了42000小时数据,主打零样本歌声合成,支持双控制方式,多语言与跨语言能力强,架构先进,评测表现优。
Kimi K2.5登顶开源第一!15T数据训练秘籍公开,杨植麟剧透K3
Kimi K2.5登上Hugging Face热榜榜首,下载超5.3万。它主打Agent能力,成绩超GPT - 5.2等闭源模型,性价比高。官方技术报告公开其用15T数据训练,还搭载Agent Swarm架构,团队还剧透了Kimi K3。
人形机器人交付元年,行业从卷模型转向拼数据
2026年是具身智能交付元年,行业从卷模型转向拼数据。全球权威机构重新定义“人形机器人数据”地位,真机数据是模型落地关键。乐聚等企业积极布局,通过训练场模式获取数据,解决行业痛点。
死掉的创业公司,成了AI最抢手的训练数据
过去一年,硅谷倒闭创业公司用数字履历重新估价,卖给AI实验室训练agent。产业链迅速形成,中游有SimpleClosure和Sunset等,下游有多家做RL gym的创业公司,不过该产业链面临隐私等敏感问题。
Figure抛弃10万行C++代码!用1000小时人类数据训练神经网络,实现全身控制基础模型
美国机器人公司Figure推出具身大脑Helix 02及家务demo。其搭载的Figure 03在厨房自主完成复杂任务,且实现端到端全身控制。新引入的System 0基于人类数据训练,替代大量手写代码,还展示多种灵巧操作。
直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?
论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和模型上验证有效,性能提升显著。
具身智能的“生命线”:数据基石与未来路径 | GAIR Live 017
雷峰网举办具身智能数据线上论坛,三位嘉宾探讨其从数据采集到闭环学习全过程。指出具身智能数据挑战严峻,分享真机数据稀缺解决方案,认为仿真合成数据是必经之路,还谈及产学协同、数据服务等内容。
刚刚,DeepSeek最新发文!V3/R1训练细节全公开,信息量巨大
网信办新规生效,DeepSeek回应,标注AI生成内容,公开V3/R1训练细节。介绍训练分预训练和优化训练,深挖数据使用,还谈及推理、开源情况,也提到对抗AI幻觉与滥用风险的措施。
模型、代码、数据全开源!轻松训练自己的垂类Agent!
Together AI联合Agentica推出`DeepSWE-Preview`,基于开源Qwen模型,用RL在SWE - Bench - Verified登顶。团队将模型权重、训练框架等全开源,抛弃SFT纯用RL训练,还分享训练秘籍和TTS技巧,为垂类Agent训练提供新范本。
干家务一小时挣1000元,具身智能时代人类新岗位
机器人是AI热门领域,但面临数据荒。训练数据分真实与合成两类,前者质量高但成本高、规模有限,后者成本低。数据标注服务商高价回收做家务等视频作训练素材,各方努力下优质数据仍短缺。