实时语音翻译」共找到 637 篇相关文章

新闻资讯7

马斯克宣布用户将可语音定制X信息流

埃隆·马斯克宣布11月X平台算法将由AI驱动,开源代码会持续更新,用户能语音定制信息流。此计划引两极反应,算法也有缺陷,还面临可信度和信息茧房等问题。

AI工程化
产品应用8

语音模型也能“freestyle”?可定制角色,模拟背景音

阿里新推两款语音模型,Fun - CosyVoice3.5可基于参考音频克隆声音,优化多方面能力;Fun - AudioGen - VD能进行‘从无到有’音色设计,并模拟复杂听觉环境。用户即日起可在阿里云百炼调用。

千问Qwen
开源动态8

12ms!一个仅8M的语音停顿检测模型

语音助手准确判断用户是否说完是挑战,Smart Turn将决策过程缩至12毫秒。其v3.1版有改进,新增数据集提升英语识别准确率,推出未量化版本推理更快,8MB模型性能优,已在HuggingFace开源。

AI工程化
开源动态7

MIDAS:快手可灵发布实时交互式数字人生成框架

近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。

带你学AI
产品应用8

世界首个「实时、无限」扩散视频生成模型,Karpathy投资站台

Decart发布世界首个「实时、无限」扩散视频模型MirageLSD,输入视频流能快速转化画面,前特斯拉AI总监Karpathy投资。它在时长和延迟上有突破,也有需改进之处。

机器之心
开源动态8

告别天价API账单!开源Chatterbox语音服务器上线,隐私与效率双赢!

第三方语音合成API成本高、有隐私风险,直接部署开源模型配置复杂。开源的Chatterbox-TTS-Server基于Chatterbox TTS模型,有Web界面、声音克隆等功能,支持GPU和Docker,可解决部署难题。

开源星探
算法论文7

现实世界的天气能复刻?Weather-Magician实时渲染下雨打雷下雪

传统工业方法在还原复杂现实场景时成本高、质量差,当前算法也难重建和渲染真实天气效果。上海交通大学提出Weather - Magician框架,能重建场景并渲染4D天气效果,对硬件要求低且可实时渲染。

带你学AI
开源动态8

这款开源神器把Excel翻译卷出新高度!免费、无限文件大小、公式精准!

翻译大型或复杂文档一直是痛点,免费工具效果差或限制文件大小,付费成本高。infrost开发的DeeplxFile基于Deeplx和Playwright打造,免费、不限文件大小,擅长处理超长文本和复杂Excel公式,还能转PDF为可编辑文件。

开源星探
产品应用7

估值 20 亿美元的语音输入法,开源平替已经 3 万 star

文章指出语音输入随着 AI 发展价值重估,介绍了开源工具 OpenLess,分析了商业订阅、开源桌面工具、大厂输入法三类玩家,给出四层评估框架,也提及开源风险,并对不同需求给出选择建议。

AI Reading Hub
开源动态8

字节推出X-Streamer,实时口型同步与长程记忆数字人框架

字节推出端到端多模态人类世界建模框架X - Streamer,能从单张人像构建可无限流式生成的数字人,实现音素级口型同步和长程记忆。其核心是“思考者–行动者”双Transformer架构,在两张A100 GPU上可实时运行。

带你学AI