多模态数据集」共找到 3285 篇相关文章

算法论文8

Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞

多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。

深度学习自然语言处理
算法论文8

抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅

视觉推理任务中,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 在推理中实时生成、执行并迭代 Python 工具,在多类任务中显著提升性能,实现范式跃迁。

深度学习自然语言处理
开源动态8

NeurIPS 25 | 中大&UC Merced等开源RAPID Hand,重新定义多指灵巧手数据

来自多机构研究者联合提出全新开源高自由度灵巧手平台 RAPID Hand。它能解决硬件瓶颈问题,实现稳定、高质量数据。其软硬协同优化,在操作表现与稳定性上优于现有方法,还具备低成本等优势。

机器之心
新闻资讯7

独家|前蔚来AI平台负责人白宇利创立「补天石科技」,聚焦具身数据 Infra 方向

前蔚来AI平台负责人白宇利创立上海补天石科技,聚焦具身数据Infra方向。该公司为机器人模型训练提供高效工程体系,首轮融资由红杉领投,团队正处早期组建阶段。

AI科技评论
开源动态8

腾讯AngelSlim升级,首个LLM、VLM及语音多模态为一体的投机采样训练框架,推理速度飙升1.8倍

随着大模型应用成本与延迟问题凸显,腾讯混元升级 AngelSlim 训练框架,将投机采样技术拓展至全模态场景。它以 Eagle3 架构让推理速度最高飙升 1.9 倍,还具全模态训练、面向部署等亮点,有开源代码。

机器之心
开源动态7

比NotebookLM更好的「开源播客」,可根据多模态内容生成30分钟以上播客音频。

Podcastfy是开源Python工具,能把文本、图片等多模态内容,借生成式AI转化为播客。它支持自定义,适配多种语言和文本转语音模型,能生成2 - 5分钟或30分钟以上的播客,使用体验比NotebookLM好。

开源AI项目落地
开源动态8

多人会话视频生成新突破:香港科技大学,浙江大学用单人数据实现多人交互视频生成

香港科技大学、浙江大学等开源 AnyTalker,提出音频驱动多人交互生成新范式。它用创新机制和两阶段训练策略,以少量数据实现多人视频生成,还构建评估指标,性能超现有方法。

AIGC开放社区
开源动态8

Soul App 又放大招!把 42000 小时数据喂出的“歌神” SoulX-Singer 开源了!

语音合成近年爆发式增长,开源领域也有强大音乐模型。Soul APP联合多机构开源的SoulX - Singer,喂了42000小时数据,主打零样本歌声合成,支持双控制方式,多语言与跨语言能力强,架构先进,评测表现优。

开源星探
开源动态8

3万小时触觉数据补齐具身智能“手感”!新智具身&复旦大学技术报告三连发

上海新智具身联合复旦发布三份技术报告,将触觉跃升为具身智能核心基建。包含统一触觉数据格式并构建3万小时语料库、以触觉预判赋能VLA、在世界模型重构触觉想象等内容,项目数据和模型将开源。

量子位
新闻资讯8

影身智能完成多轮融资,用原生3D数据重新定义机器人认知|甲子光年

影身智能已连续完成多轮融资,累计近亿元。其以‘原生3D动态世界模型’为核心技术,采用与市场不同的‘升维’思路,用自研的‘影身360’系统采3D数据,还落地柔性智造行业,目标是打造通用人工智能产品。

甲子光年