「语音功能」共找到 1743 篇相关文章
清华&巨人网络首创MoE多方言TTS框架,数据代码方法全开源
清华与巨人网络联合首创 DiaMoE-TTS 多方言 TTS 框架,数据、代码、方法全开源。它基于 IPA 体系,有 MoE 架构和低资源适配策略,在多语种验证,为方言语音合成提供低成本、可扩展方案。
清华大学x生数科技:从波形到隐空间,AudioLBM引领音频超分新范式
音频超分辨率是提升音频体验的关键技术,但高频细节损失是挑战。OpenAI的Sora 2树立高保真音频生成标杆,现有学术模型有局限。清华与生数科技团队发表两项成果,AudioLBM展现通用高分辨率音频生成潜力。
一手实测全新的Sora 2 - AI视频的ChatGPT时刻到来了。
OpenAI发布Sora 2和Sora APP,Sora 2是视频和音频生成模型,在运动质量、人物表演、音频生成等方面表现出色;Sora APP类似AI版抖音,有社交互动“cameos”功能,但产品未来尚不明朗。
高性能全闪并行文件系统的设计和实践
焱融科技 CTO 张文涛在 QCon 大会分享‘高性能全闪并行文件系统的设计和实践’,介绍了焱融全闪文件存储架构和 YRCloudFile 技术细节,分享其解决 AI 训练存储难题的方案。
Anthropic发布Claude Sonnet 4.5:编程能力再登顶,新产品试图颠覆Windows操作系统
今日凌晨Anthropic发布Claude Sonnet 4.5,该版本在编程、计算机使用等能力上显著提升,开放Claude Agent SDK,还推出多项产品功能更新及“Imagine with Claude”研究预览,或对AI编程和Agent产品洗牌。
自动生成 AI 领域 Reddit 趋势报告
该项目可自动从Reddit AI相关社区生成双语趋势报告。具备实时监控、多社区分析等功能,有详细趋势分析。介绍了安装设置、使用方法、创建仓库、自定义配置等内容,助用户掌握AI领域发展。
模型测试不再跳来跳去,VS Code + Hugging Face = 真香
Hugging Face 发布新功能,让开发者在 VS Code 的 GitHub Copilot Chat 中直接接入 Inference Providers,可调用 Kimi K2 等开源大模型测试,无需频繁切换平台。该功能有统一 API 等优势,定价门槛低。
阿里开源 Wan2.2-Animate!统一角色动画和视频人物替换
阿里通义实验室开源 Wan - Animate,这是用于角色动画与替换的统一框架。它构建于 Wan 模型之上,支持角色动画和角色替换两项核心功能,性能超现有算法,还通过独特设计实现多种效果。
Pogocache:开源缓存软件实现低延迟并支持多传输协议
全新开源缓存软件 Pogocache 近日发布 1.0 正式版,主打低延迟与 CPU 高效能特性,支持多种主流通信协议,宣称比其他开源缓存方案有更高吞吐量和更低延迟。还介绍了其架构、应用场景等。
=COPILOT()函数横空出世!AI自动写公式效率起飞,网友:让Excel再次伟大
微软官宣在Excel引入全新的=COPILOT()函数,用自然语言提需求就能让其干活。它内置在Excel引擎,能与现有函数协作,还可自动刷新结果。网友称这将改变数据分析,让Excel再次伟大。