语音数据集」共找到 2814 篇相关文章

产品应用8

AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用

深势科技推出玻尔·跃迁实验室,解决传统实验室设备割裂、经验依赖、数据离散、部署低效等痛点,围绕计算 - 实验 - 数据 - 计算无缝闭环底层重构,与传统 ELN/LIMS 不同。

量子位
算法论文8

从单领域到多能力协同:数据混合如何重塑AI的强化学习

上海AI Lab的OpenDataLab团队通过大规模实验剖析可验证强化学习(RLVR)在多领域推理中的机制,发现逻辑与数学数据相互支持、代码推理有跨领域混合效应等,为构建AI推理模型提供关键发现。

深度学习自然语言处理
开源动态8

蚂蚁灵波开源LingBot-VLA后训练代码!150条示教数据即可适配新机器人

蚂蚁团旗下灵波科技全面开源具身基座模型LingBot-VLA的真机后训练工具链,覆盖四个关键环节。模型基于2万小时真实机器人数据预训练,仅需150条演示数据就能迁移任务,训练效率更高。代码库已在GitHub开源。

量子位
新闻资讯7

智能流体力学专题研讨会特邀报告2|肖恒:turbX——基于多目标学习的通用数据驱动湍流建模

2026年8月,第十四届全国流体力学学术会议在山东青岛举行,智能流体力学专题研讨会展示了人工智能与流体力学交叉研究进展。本次聚焦《turbX:基于多目标学习的通用数据驱动湍流建模》报告,研究来自斯图加特大学相关机构。

力学与人工智能
算法论文8

EAAI | 香港理工大学王旭等:一种增强MFNN的多源气动数据重构方法

飞行器气动压力分布获取依赖风洞试验或数值模拟,多源数据差异为气动数据重构带来挑战。本研究提出增强型多保真神经网络,通过差分运算提升模型泛化精度,在跨声速压力分布重构中效果显著。

力学与人工智能
产品应用7

实时语音翻译

Sokuji 是跨平台桌面应用,用 OpenAI、Google Gemini 等 API 提供实时语音翻译。支持多系统,有桌面版和浏览器插件,适配会议场景,还具备音频可视化、虚拟音频设备等特色功能。

GitHubStore
算法论文8

备受Meta折磨,LeCun依旧猛发论文!新作:JEPAs不只学特征,还能精准感知数据密度

备受Meta审核规定“折磨”,LeCun仍发新论文。其团队发现自监督模型JEPAs学会了数据“密度”,打破学界以往认知。还提出JEPA - SCORE工具,经多组实验验证其效果。

量子位
开源动态8

开源TTS语音新标杆!Kyutai TTS:350ms延迟碾压全场,词级时间戳重构!

法国AI实验室Kyutai开源高性能TTS语音模型Kyutai TTS,基于DSM框架,支持流式输入、超低延迟与高保真语音生成,有多项亮点,还给出不同使用方式及应用场景。

开源星探
开源动态8

英伟达开源上瘾了!推出了一款实时语音智能体的终极 ASR:24ms 极速锁定。

英伟达开源了Nemotron Speech ASR模型,它是低延迟、实时流式语音识别模型,单句转录锁定仅需24毫秒。其核心能力包括缓存感知、运行效率高、动态运行灵活,还被放进完整语音智能体方案。

开源星探
开源动态8

阿里杀进Agent上下文战场:钉钉聊天、企业文档、工作数据终于要被Agent吃进去了

个人、企业用户苦工作场景「上下文」久矣,Agent常不懂真实业务。阿里千问办公开源的「MyContext」,将分散工作数据加工成Agent可消费的上下文,处理多种难题,还将能力向组织延伸,助力Agent融入工作流。

量子位