单演示数据生成」共找到 4344 篇相关文章

算法论文8

ICML 2025|多模态理解与生成最新进展:港科联合SnapResearch发布ThinkDiff,为扩散模型装上大脑

现有扩散模型缺乏多模态推理创作能力,在算力和数据不充裕时实现该功能是难题。ICML2025上,港科联合SnapResearch提出ThinkDiff,以较少资源让扩散模型有思考能力,开辟多模态理解生成新路径。

机器之心
开源动态8

NeurIPS 2025 | 面向具身场景的生成式渲染器TC-Light来了,代码已开源

TC-Light 是中科院自动化所张兆翔教授团队研发的生成式渲染器,能对长视频序列重渲染,减少 Sim2Real Gap 及实现数据增强。它克服了时序一致性和计算开销挑战,性能优于现有技术,论文与代码已开源。

机器之心
算法论文8

怎么量化机器人数据价值?ATHENA将影响函数扩展到十亿参数VLA,313×加速筛选高价值数据

具身智能进入数据scaling时代,VLA模型训练中数据并非越多越好。上海交大同济等校团队提出ATHENA框架,将影响函数扩展到十亿参数VLA模型,解决计算和筛选难题,实现313倍加速,实验证明其用更少数据获更好效果。

机器之心
算法论文8

“坏”数据让模型更“好”?重新审视数据过滤

传统观点认为大型语言模型预训练应过滤“坏数据”,但论文《When Bad Data Leads to Good Models》提出反直觉观点,适度加入有毒数据,通过后训练技术可降低模型毒性,保持一般能力,挑战常规做法。

深度学习自然语言处理
推荐文章7

关于机器人数据,强化学习大佬Sergey Levine刚刚写了篇好文章

训练大模型难度随规模和应用拓展而增加,所需数据海量。机器人领域获取训练数据成本高,研究者尝试找替代方案。强化学习大牛Sergey Levine分析数据组合,认为鱼和熊掌不可兼得,替代数据有局限。

机器之心
新闻资讯7

全球看中国,灵初智能用10万小时人类数据写下具身智能的中国答案

2026年,“世界模型”成具身智能高频词。灵初智能联合创始人陈源培认为其非核心方向,而是数据迁移工具。灵初关注人类操作数据转化,在10万小时量级上可大幅替代真机数据,还介绍了系统模块、数据集及商业化阶段等情况。

机器之心
推荐文章7

技术更新 or 组织重塑,企业如何用好“数据智能”?

InfoQ《极客有约》X AICon 直播栏目邀专家探讨企业数据智能应用。谈及构建数据集、优化检索效率等问题,还分析数据准备挑战、DeepResearch 优势,指出数据智能落地面临组织与技术层面的挑战。

InfoQ
推荐文章7

Agent时代,为什么多模态数据湖是必选项?

AI时代,数智化底层是基建深耕。企业要构建多模态数据湖,因其能处理多模态数据,唤醒沉睡数据,驱动业务,还提供工程确定性。火山引擎给出升级路线及选型指南,其多模态数据湖已在多行业落地。

机器之心
开源动态8

性能飙升42%!人大&字节开源10万级 SWE数据集 Scale-SWE

近期,人大和字节开源10万级软件工程数据集Scale - SWE,用首创工作流从GitHub构建真实数据。基于此微调的Qwen3 - 30A3B - Instruct模型测试表现佳,其数据相比合成数据优势明显。

PaperAgent
产品应用7

让AI自动生成工作流

不会搭建工作流没关系,可让AI自动生成。如用Claude帮搭建n8n工作流,它生成JSON文件,复制粘贴到n8n配置节点即可用。介绍n8n特点,还讲了Claude自动生成n8n工作流的操作步骤。

newtype AI