「语音分离」共找到 321 篇相关文章
VoxCPM2:无tokenizer语音合成,高保真声音克隆
VoxCPM2突破传统TTS系统局限,直接操作连续声学特征,保留音色纹理更完整。基于扩散自回归架构,有硬核技术指标,提供三种克隆模式,性能佳,生态完善,微调便捷,但也存在安全风险。
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
阿里Qwen3一大波更新:代码生成、视频、图片、语音全都有
阿里Qwen3迎来一大波更新,涵盖多个模型。如Qwen3-Max在代码与智能体表现卓越;Qwen3-VL是强大视觉语言模型;Qwen3-Omni是全模态模型;还有图像编辑、同传、安全防护等模型及旅行规划师等应用。
告别传统存算分离,AI时代数据底座迎来全新底层逻辑
文章围绕AI时代数据底座变革展开。指出传统大数据平台难适配AI,存在数据够不着、模型用不好等问题。阐述AI时代基础设施变化,如数据形态、计算模式等。还探讨底座升级条件、存储挑战、算子价值及未来标准层等内容。
太简单啦,Call Center AI开源代码=AI语音客服,论文Demo一步到位,毕业设计神器!
Call Center AI是微软开源的AI呼叫中心解决方案,基于Azure相关服务和Azure OpenAI GPT,支持自动拨接电话等功能。能解决坐席不足等痛点,有一键API等亮点,适用于保险、IT支持等场景。
EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智分离"新范式
当前大视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。
Meta CTO打脸扎克伯格:首秀翻车全因致命bug,AI智商捉急、语音交互全面崩盘
Meta Connect开发者大会上,Meta发布三款智能眼镜,现场演示却屡屡翻车。扎克伯格归咎于Wi-Fi,CTO Bosworth否认,称是资源管理失误和软件bug所致,但网友对此解释并不买账,质疑团队能力。
Meta CTO打脸扎克伯格:首秀翻车全因致命bug,AI智商捉急、语音交互全面崩盘
Meta Connect开发者大会上,Meta发布三款智能眼镜,现场演示却屡屡翻车。扎克伯格将问题归咎于Wi-Fi,CTO Bosworth否认,称是资源管理和软件错误。网友对Meta解释不满,质疑团队能力。
还在花钱转语音?10,000+ star 开源「ebook2audiobook」白嫖1107种语言!免费文字秒变多语言音频!
`ebook2audiobook` 是由 Drew Thomasson 主导、13k+ Stars 的开源工具,能将电子书无缝转换为有声书,支持 1107+ 语言,有章节拆分、多 TTS 引擎支持等功能,低门槛部署,适合多场景。
谷歌 AI Studio 实时视频对话终于支持中文了!屏幕共享+语音,Gemini 2.5 Flash 原生音视频加持。
谷歌AI Studio实时视频对话支持中文,有Gemini 2.5 Flash原生视频对话模型。使用方便,还提供多种音色,有让模型在无声时发音视频等功能,可用于设计、学习、修电脑等场景。