语音问一问」共找到 1535 篇相关文章

新闻资讯7

OpenAI 详解规模化低延迟语音 AI 的 WebRTC 架构

OpenAI 介绍为全球规模低延迟语音 AI 调整 WebRTC 架构,将传统媒体终结模型换为中继收发器架构,分离职责,避免复杂逻辑堆砌与转嫁。此架构为实时语音技术布局补充基础设施细节,对架构师有参考价值。

InfoQ
开源动态8

面壁小钢炮 VoxCPM-TTS:开源端到端 TTS,轻量高效低延迟

面壁提出基于扩散自回归建模的端到端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。

带你学AI
推荐文章7

人公司创业,如何找对方法论、选准装备库?

AI让人做产品更易,全国人有限责任公司数量增长,相关服务生态成形。时踪由阿泰独立研发,从个人痛点出发做出产品,其95%云服务选阿里云。阿里云为OPC创业者提供阶段化“装备库”。

AI前线
算法论文8

后生可畏!何恺明团队新成果发布,共清华姚班大二在读

何恺明团队继5月提出MeanFlow (MF) 后,近日推出改进版Improved MeanFlow (iMF),解决了原始MF三大核心题。它重构预测函数,还实现灵活的无分类器指导和高效的上下文内条件作用架构,提升了实用性和效率。

量子位
开源动态8

Meta发布Omnilingual ASR:支持1600+语言的开源语音识别系统

Meta发布全新自动语音识别系统Omnilingual ASR,支持超1600种语言,核心创新是零样本和少样本学习能力,降低小语种语音识别门槛。项目提供不同规模模型,安装调用简单,目前仅支持40秒内音频,数据集和项目均开源。

AI工程化
新闻资讯8

刚刚,国产AI双冠王!黑马世界模型打破全球纪录,镜到底封神

生数科技的MotuBrain零宣发登顶双榜,打通「看懂世界+执行行动」,适配多个头部机器人本体。它基于Motus进化,具备多本体、多任务、长程执行能力,展示出强大的「脑多能」和「脑多型」特点。

新智元
产品应用7

有嘴就能用电脑的时代来了

作者分享语音输入体验,先自制工具,后用微信输入法,现用豆包输入法。指出语音输入对内容创作者等很重要,介绍豆包输入法优点,还提到语音输入成AI核心场景及使用建议。

刘言飞语
新闻资讯7

突发!阿里Qwen负责人林俊旸官宣卸任

深夜,阿里Qwen灵魂人物林俊旸突然官宣卸任,离开千项目,还有两位Qwen团队研究员同时离职。林俊旸履历耀眼,32岁成阿里最年轻P10,带领团队将千系列全面开源。

新智元
新闻资讯7

我的合伙人是AI|甲子光年

文章讲述AI时代“人公司”新现象,多位创业者借助AI构建企业运作逻辑。如叶纯俊的公司用AI完成多环节工作,许婷团队让AI参与编程。同时提到投资态度转变,“人公司”发展有挑战也有机遇。

甲子光年
新闻资讯7

前百川智能联创焦可新创业公司曝光,新项目已上线 App Store

前百川智能联创焦可新创业公司曝光,其推出的AI语音产品“来福”已上线App Store。该产品定位AI语音电台应用,探索声音交互场景,目前仅邀测。国内大厂未推专注AI播客独立产品。

AI科技评论