「超长语音合成」共找到 472 篇相关文章
刚刚,豆包「成精」了!一夜告别机械感,上亿人手机全量上线
字节跳动Seed团队发布原生全双工语音大模型Seeduplex,已在豆包App全量上线。它边听边说、懂思考停顿、抗干扰强,解决了精准抗干扰与动态判停难题,工程上也有突破,提升了交互体验。
阿里 Qwen3-TTS 全新上线!支持9种方言+49种音色,连天津味儿都拿捏了!
阿里通义团队上新 Qwen3-TTS 文本转语音模型,主打拟人语音表达、丰富音色体系与多语言多方言能力。有 49 种高保真音色,支持 10 种语言、9 种方言,还能智能调节语速和韵律。
妙笔生维:线稿驱动的三维场景视频自由编辑
研究人员提出基于线稿的三维场景视频编辑方法Sketch3DVE,相关论文发表于SIGGRAPH 2025。它能让用户基于线稿重塑三维场景视频,解决了现有方法个性化不足、真实感差等问题,支持单目图像三维视频合成和二次编辑。
让AI自我进化?斯坦福华人博士答辩视频火了,庞若鸣参与评审
斯坦福大学博士生 Zitong Yang 完成「持续自我提升式 AI」博士论文答辩并分享视频。他针对当前模型局限提出解决方案,涵盖合成持续训练、预训练能力自我提升、迈向 AI 设计 AI 三个核心方向,引发行业关注。
Le Chat全方面对标ChatGPT,欧洲AI新贵穷追不舍
欧洲AI初创公司Mistral AI接连发布多个开源模型,还升级Le Chat,引入深度研究、语音等新功能,全方面对标ChatGPT。其语音识别模型Voxtral号称“全球最佳”,多方面超越竞品。
3D多光照场景渲染!GRGS带来真实感重光照
哈工大提出通用3D高斯框架GRGS,用于多样光照下高保真人体新视角合成。它采用前馈监督策略,支持可编辑光照,结合物理着色与神经网络推断,合成逼真效果,但处理透明材质和纤薄结构欠佳。
8.8K Star!真正的本地实时 Whisper 开源神器,彻底干翻云端 STT!
做实时语音转文字系统,上云端 API 贵且隐私难保障,本地跑 Whisper 延迟高。WhisperLiveKit 是专为本地流式语音识别优化的全栈方案,解决了 Whisper 痛点,有极速处理等功能,适用多类项目。
从「偶然发现」走向「必然创造」:AI如何重塑生物制造全链路?
2026年1月9日“第四届合成生物学及生物制造大会”上,深圳瑞德林李加忠指出AI4S驱动合成生物学变革,从“经验驱动”变为“数据与逻辑驱动”,并分享瑞德林通过AI4S重塑生物制造全链路的实践。
千人千面的真人级AI名师,劈开教育「不可能三角」
与爱为舞推出的AI导师能个性化教学,服务百万用户。其用「模型+语音+工程」铸造技术巨剑。经训练,AI可驾驭课堂,再经自研语音模型实现交互,通过链路优化等实现规模化落地,践行「全员皆超级个体」理念。
视频字幕处理开源神器
卡卡字幕助手(VideoCaptioner)操作简单,无需高配置,支持 API 和本地离线语音识别,利用大语言模型处理字幕。它支持多平台视频下载处理,有专业语音识别引擎,能智能纠错、高质量翻译、调整字幕样式。