「训练数据合成」共找到 3974 篇相关文章
ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集
来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。
535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺
当多数模型公司还在争论是否开放权重时,斯坦福大学的Marin项目启动535B-A23B模型训练,并公开训练过程。该项目旨在探索基础模型能否像开源软件一样被公开研究和建设,引发关注。
无需人工标注!AI自生成训练数据,靠「演绎-归纳-溯因」解锁推理能力
新加坡国立大学等机构研究者提出元能力对齐训练框架,模仿人类推理心理学原理,将演绎、归纳与溯因能力融入模型训练。实验显示,该方法提升模型在多任务上的性能,且有跨领域可扩展性。
上交、清华、微软、上海AI Lab等联合发布数据分析智能体综述,LLM化身数据分析师,让数据自己「说话」
传统数据分析方法耦合度高、扩展性差,大语言模型与智能体让数据分析迈向“语义理解”。上交、清华等机构联合撰写综述,回顾演进,提出新范式,总结关键技术、趋势及挑战,推动通用数据分析智能体发展。
中科院类脑大模型SpikingBrain,2%数据,百倍速度
中国科学院自动化研究所李国齐、徐波团队发布全球首款大规模类脑脉冲大模型SpikingBrain 1.0。它处理长文本比主流Transformer模型快超百倍,训练数据仅为2%。该模型采用新架构,降低计算复杂度,还可转换现有模型,且在国产GPU完成训练。
具身智能的无本体数据,终于有了自己的「代表作」
自变量机器人发布的Demo中,机器人用数百条无本体数据完成化学实验。其发布的TwinDEX系统由无本体数据采集系统和机器人末端执行器组成,能让无本体数据获接近真机数据的训练效果,重新定义数据采集逻辑。
RL成本降幅超90%!Meta提出Agent训练新范式DreamGym
传统强化学习(RL)训练LLM Agent面临成本高、任务多样性不足等挑战。Meta团队提出DreamGym框架,以经验合成为核心,通过三大组件协同工作,在多种任务和模型上提升性能,为通用Agent训练开辟新路径。
只训练数学,却在物理化学生物战胜o1!新强化学习算法带来显著性能提升,还缓解训练崩溃问题
上海创智学院、上海AI Lab的MM - Eureka系列工作提出新强化学习算法CPGD,缓解训练崩溃问题,提升性能。还构建多模态强化学习框架,推出MMK12数据集和MM - PRM模型,开源相关成果。
真·养虾!3步让龙虾边聊边进化,不用GPU不用数据集就能强化学习
程序员给智能体套在线强化学习系统MetaClaw,把用户与AI对话变训练数据。它基于Kimi - 2.5,用SkillRL框架,不依赖本地GPU,训练交Tinker云平台,三步即可上手。
Thinking Machines发布首个产品Tinker :大模型后训练彻底变天
OpenAI前CTO Mira Murati的Thinking Machines公司发布首个产品Tinker,这是为微调大模型设计的灵活API,能简化LLM后训练过程,让用户专注算法和数据,平台处理分布式训练。它有多种特性,已被顶尖机构采用。