仿真合成数据」共找到 2627 篇相关文章

算法论文8

LLM的下一战:从狂卷数据到精算数据

大模型竞争核心正从比拼数据规模转向数据使用效率和风险管理。文章分享2025两篇论文,介绍高效训练和机器遗忘两赛道,前者有数据价值飞轮5大模块,后者提出三时段分类法、三层次遗忘及评价指标全景。

PaperAgent
新闻资讯7

别只盯着李飞飞!AI的「3D数据底座」已被这家中国公司悄悄建好

群核科技构建具身智能时代的「3D版ImageNet」,其SpatialVerse平台为机器人提供三维数据仿真环境。借助新技术发布全球首个3D语义数据集InteriorGS,还与多机构合作,成果获学术和产业认可。

新智元
推荐文章7

这波AI淘金热里,卖“铲子”的公司正闷声发财,“征服"了几十家国内外巨头!

光轮智能联合创始人杨海波表示,AI发展让合成数据需求增大。该公司为具身智能行业提供3D合成数据,服务众多头部企业。其优势在于技术视野与路径独特,强调物理交互、人类示范等。还谈及创业要点与AI赛道变化。

AI前线
算法论文8

图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果

百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。

量子位
算法论文8

TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
开源动态8

The Batch: 869 | 编码助手的训练数据

研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。

DeeplearningAI
产品应用8

具身智能的无本体数据,终于有了自己的「代表作」

自变量机器人发布的Demo中,机器人用数百条无本体数据完成化学实验。其发布的TwinDEX系统由无本体数据采集系统和机器人末端执行器组成,能让无本体数据获接近真机数据的训练效果,重新定义数据采集逻辑。

AI科技评论
开源动态8

EmbodiChain开源,用100%生成式数据自动训练具身智能模型

跨维智能开源EmbodiChain,它是通往GS - World的基石,重构具身智能学习范式。其以100%生成式仿真数据训练机器人,突破数据瓶颈,还对比了不同路线,测试显示其模型效果佳。

机器之心
新闻资讯8

一副手套,干翻硅谷炫技派!中国队杀入战场,狂卷100万小时数据

硅谷具身智能玩家为数据发愁,中国灵初智能另辟蹊径,用数据手套采集工人操作数据,成本低且数据泛化性强。其专注物流细分场景,2026年收敛资源做深现有场景,目标推100万小时数据训练模型。

新智元
新闻资讯7

全国首部“高质量数据集验收”标准,现公开征集起草单位和专家!

国家数据局等明确支持数据流通服务机构与人工智能企业合作,凸显数据到模型训练与产业应用环节的重要性。现有数据质量标准在产业场景有缺口,全国首部《人工智能训练数据集交付与质量验收规范》团体标准应运而生,现征集起草单位和专家。

AI大模型应用实践