「微调数据」共找到 2673 篇相关文章
告别“炼丹玄学”:上海AI实验室推出首个大模型数据竞技场OpenDataArena
上海人工智能实验室OpenDataLab团队推出开放数据竞技场OpenDataArena,致力于将数据质量评估从“玄学”变为“科学”。它有数据评测榜单和完整可复现的数据价值验证体系,为多类需求提供解决方案,还开源了核心工具。
单卡即可微调大模型!内存占用仅1/8,性能依然拉满 | ICML 2025
基础大模型应用于下游任务时微调成本高,低秩适应(LoRA)方法虽降低成本,但性能不及全量微调。华中科技大学和香港中文大学团队提出GOAT框架,在25个多领域任务验证效果好,内存占用仅1/8。
付费Mathpix公式识别不香了~不要钱舒服!
复杂科学文献中公式识别问题重要,但现有模型有局限。DocTron - Formula通过简单微调在多场景达先进水平,还引入CSFormula数据集。它基于Qwen2.5 - VL微调,在多个数据集上效果佳。
RLinf上新πRL:在线强化学习微调π0和π0.5
近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。
数据分析师,即将从工业领域“消失”?
2023年底Google裁撤数据科学家引发关注,AI+BI普及使岗位裁撤风潮蔓延至工业领域。2025年7月TDengine发布TDengine IDMP,主打“无问智推”,有望带来数据消费范式革命,加速工业智能化转型。
又一家清华系具身智能企业浮出水面:天使轮融资数千万元,打造具身数据Infra丨甲子光年
清华系具身智能企业灵御智能完成数千万元天使轮融资,累计融资近亿元。其聚焦打造具身数据Infra,研发TeleAvatar和TeleDroid构建数据采集母机,锁定三类应用场景,还从两方面压缩成本。
The Batch: 968 | Muse Code 想获取你的数据
Meta推出Muse Code编码框架及Muse Spark 1.2模型,有不同输入输出、功能和性能表现。提供不同档位价格,贡献者档位低价但数据用于训练。测试显示其单任务成本低,Meta此举或为获取编码训练数据。
李静海院士团队:未来数据系统的逻辑与架构 | Engineering
本文展望数据科学未来,强调其对AI重要性。探讨科学数据系统挑战,提出收集处理原则,指出要重视数据系统逻辑与架构研究,建立标准协议框架,促进AI健康发展。
告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级大模型
麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。
GAIR 2025 「数据&一脑多形」分论坛,激辩 AI 演进路径
在 12 月 13 日 GAIR 大会“数据&一脑多形”分论坛上,探讨了数据价值重构与“一脑多形”架构革命。多位嘉宾围绕具身智能数据、“一脑多形”技术展开分享与讨论,为人工智能发展提供新思路。