实时语音识别」共找到 764 篇相关文章

产品应用8

波士顿动力机器人进厂打工现逆天操作!3D感知+实时追踪,人类捣乱完全不带怕的

波士顿动力的Altas机器人重磅升级,具备3D空间感知和实时物体追踪能力,可自主执行复杂工业任务。文章还解析其背后技术,包括2D感知、3D感知、物体位姿估计和校准等,团队未来将构建统一基础模型。

量子位
开源动态8

狂涨10.3K star!最近爆火的微信记录训练专属数字分身,支持语音克隆,绝了!

在AI大模型时代,大家想让模型更个性化。最近GitHub爆火的开源项目`WeClone`,用微信聊天记录训练专属AI打造数字分身,还能语音克隆。它全链路覆盖、支持多模型,有隐私保护等特色,操作也有介绍。

开源先锋
开源动态7

开源播客TTS神器!高效TTS模型:Muyan-TTS,0.33秒生成1秒音频,零样本语音合成!

介绍新发布的开源TTS模型Muyan - TTS,它专为播客场景设计,以超低延迟实现零样本语音合成,预训练大量播客数据,支持长内容连贯生成,还介绍了使用步骤、适用场景等。

开源星探
算法论文8

语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究

清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。

机器之心
产品应用8

AI搜索MCP服务来了,Agent直接链接实时信息!刚刚,百度智能云打出了张“王牌”

‘Agent元年’进程过半,Agent卡在‘信息断层’瓶颈。百度智能云千帆平台开放百度AI搜索能力,补上Agent实时信息短板。同步登场的千帆4.0多维升级,聚合150+精选模型服务,构建企业级Agent有四大关键要素。

量子位
开源动态8

1.7K Star 新晋神器!一款轻量、开箱即用的终端日志神器,AI 助力、实时可视化,效率飞升!

现在系统日志信息量大、噪声多,传统工具定位问题既慢又麻烦。而开源工具Gonzo基于Go语言开发,有实时日志流处理、交互式仪表盘等功能,安装简单,打破传统工具局限,节省时间。

开源先锋
开源动态8

Soul APP 开源首个 14B 实时数字人!0.87秒延迟+32fps,冲进 I2V 趋势榜 TOP5!

AI圈对数字人爱恨交加,因其存在太假、太慢、太僵硬等问题。Soul App旗下AI团队开源实时数字人生成模型SoulX - FlashTalk,参数量14B,有亚秒级延迟、高帧率等亮点,冲进HuggingFace I2V趋势榜TOP5。

开源星探
开源动态8

B站出海的强有力支柱:最新开源文本转语音模型IndexTTS-2.0标志零样本TTS进入双维度时代

B站Index团队开源文本转语音模型IndexTTS - 2.0,引发关注。它解决了传统AR模型时长控制难题,实现零样本TTS双维度控制,在多方面表现优异,为B站出海及AIGC应用奠定基础。

机器之心
算法论文8

因果发现大模型迎来「理论破局」: DAG-FM 破解异质机制下的因果图识别与涌现难题 | GAIR Paper 116

浙大、清华与稳准智能联合发布因果发现大模型DAG - FM,解决了现有模型缺乏理论基础、易产生非法环路和显存爆炸问题。它在理论上证明因果图可识别,架构上避免环路,处理数据能力强,还将推进特定领域预训练。

AI科技评论
新闻资讯8

一天两枚“代码核弹”:OpenAI 祭出首个“主打实时协作”的 Codex 模型,谷歌放出 Gemini Deep Think,码力冲到世界前8

OpenAI 发布 GPT - 5.3 - Codex - Spark 研究预览版,专为实时编码设计,降低交互延迟。谷歌更新 Gemini 3 Deep Think,面向科研与工程难题,在多领域测试表现出色,二者引发网友热议。

InfoQ