同步语音技术」共找到 3140 篇相关文章

产品应用8

小米AI语音新框架:人人都能当声音导演

小米大模型应用团队提出Midasheng - audio - generate与Xiaomi Any2Speech两大音频生成框架。前者可实现全场景声音重建,后者让AI学会理解声学空间与叙事逻辑,改变了语音合成应用场景与思路。

量子位
开源动态7

Voices 能够让 Java 应用程序快速实现文本到语音转换

Voices 是开源文本转语音项目,为 Java 17 及以上应用设计,无需外部 API 或手动安装软件。可按字典或 OpenVoice 为不同语言生成音频,其使用 ONNX Runtime 加速,还介绍了使用方法和配置。

InfoQ
开源动态8

春晚武BOT论文来了!王兴兴署名,同步开源其架构

宇树发布武BOT技术论文,王兴兴署名,同步开源OmniXtreme架构。该架构通过双阶段框架,打破学习和物理可执行性瓶颈,在高保真度与可扩展性间权衡,经测试在真实硬件上表现出色。

AIGC开放社区
新闻资讯7

马斯克宣布用户将可语音定制X信息流

埃隆·马斯克宣布11月X平台算法将由AI驱动,开源代码会持续更新,用户能语音定制信息流。此计划引两极反应,算法也有缺陷,还面临可信度和信息茧房等问题。

AI工程化
产品应用8

语音模型也能“freestyle”?可定制角色,模拟背景音

阿里新推两款语音模型,Fun - CosyVoice3.5可基于参考音频克隆声音,优化多方面能力;Fun - AudioGen - VD能进行‘从无到有’音色设计,并模拟复杂听觉环境。用户即日起可在阿里云百炼调用。

千问Qwen
开源动态8

12ms!一个仅8M的语音停顿检测模型

语音助手准确判断用户是否说完是挑战,Smart Turn将决策过程缩至12毫秒。其v3.1版有改进,新增数据集提升英语识别准确率,推出未量化版本推理更快,8MB模型性能优,已在HuggingFace开源。

AI工程化
算法论文8

从Demo到行业落地的Agents:技术、应用与评估

通用LLM Agent工业落地有短板,哈工大深圳与华为提出L1 - L5工业Agent能力成熟度框架,映射技术演进与产业场景,覆盖50+行业案例、300+评测基准,给出可量化‘爬级’路线。

PaperAgent
推荐文章8

深入理解OpenClaw技术架构与实现原理(上)

文章深入解析OpenClaw技术架构与原理,它以Gateway为核心,是高度灵活的个人AI助手系统,改变了软件开发范式。涵盖统一控制平面、推理循环、定时任务等多模块。如Gateway负责消息路由等,推理循环控制运行逻辑。

阿里云开发者
算法论文8

刘陈立领衔!六国学者联合发布亚洲合成细胞技术路线图

由刘陈立牵头的联合团队发表论文,提出亚洲合成细胞技术路线图。它指出构建合成细胞的四大挑战,提出新型研究范式和十年两阶段目标,体现亚洲科研协作原创探索,推动国际合作。

DeepTech深科技
开源动态7

OVI:统一的音视频生成模型,声音与画面同步诞生

音视频生成领域以往多阶段架构易致音画不同步等问题。耶鲁大学团队提出 OVI 统一范式,采用双塔 DiT 架构与分块式跨模态融合机制,实现音画同步生成,不过目前有计算开销大、音频有局限等问题。

带你学AI