语音分离」共找到 321 篇相关文章

开源动态8

5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!

今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。

开源星探
新闻资讯8

麻省理工AI放王炸!无需说话、秒懂你的想法,外挂AI大脑来了

今天凌晨2点,麻省理工学院分享突破性研究Alterego。它是可穿戴无声语音交互AI设备,通过捕捉神经肌肉信号实现无声沟通,处理后用骨传导耳机反馈结果,应用场景广泛,还能帮助残疾人交流。

AIGC开放社区
产品应用7

揭秘 Uber 跨区域数据湖与灾难恢复机制:350PB 数据、数百万事件、单一系统

Uber构建的HiveSync是分片式批量复制系统,能让Hive和HDFS数据跨区域同步,每天处理数百万Hive事件。它基于Airbnb ReAir扩展,分离控制与数据平面,有复制和数据修复两组件,未来计划拓展到云端。

InfoQ
产品应用7

榨干Codex!OpenAI工程师亲授Codex真正用法

OpenAI客户支持工程师Jason称,Codex不只是编程助手,而是完整电脑工作系统。通过持久对话流留存记忆、语音输入精准表达、自动化接管任务等,能让机器高效完成各类工作,人还可随时干预。

AIGC开放社区
产品应用8

中国AI Agent产业化参考范本:斑马口语攻克的四大技术难关

2025年AI产业转折,通用大模型落地难,垂直场景成关键。斑马口语作为垂直落地的AI Agent,突破实时交互、语音识别、内容适龄、多模态呈现四大技术难关,为中国AI Agent产业化提供范本。

机器之心
产品应用8

AI 驱动的数据库心脏:如何让云原生「自我进化」

本文深度解析腾讯云自研云原生数据库 TDSQL - C,它融合 Serverless、AI 技术,解决传统数据库痛点。具备存算分离、智能伸缩、AI 预测等特性,能降本增效,还可全球部署,为企业数字化出海提供数据基座。

InfoQ
开源动态8

刚刚,DeepSeek 突发梁文峰署名新论文:V4 新架构提前曝光?

今天凌晨,DeepSeek在其GitHub官方仓库开源了新论文与模块Engram。该论文提出“查—算分离”机制,通过引入可扩展的查找记忆结构,在等参数、等算力条件下提升模型表现,代码与论文全文均已开源。

AI前线
新闻资讯7

突发!曝阿里通义薄列峰离职,此前为应用视觉团队负责人

五一节后爆料阿里通义实验室应用视觉团队负责人薄列峰于4月30日离职。他曾带领团队做出爆款功能,现加入某互联网大厂。今年2月语音团队负责人鄢志杰也已离职,接替人选均成谜。

量子位
算法论文8

免剪辑直出!AI生成多角色同框对话视频,动态路由精准绑定音频

Bind-Your-Avatar基于扩散Transformer框架,通过细粒度嵌入路由将语音与角色绑定,实现精准音画同步,还引入数据集MTCC和基准测试,实验显示其在身份保真和音画同步上优于现有方法。

新智元
算法论文8

POF|西工大廖晖、刘溢浪等:数据驱动的湍流建模:基于符号回归与数据同化的双向耦合框架

针对传统湍流模型在高雷诺数分离流动中精度不足与耦合不稳定问题,本文提出融合符号回归与数据同化的白箱建模框架(DASR)。该方法提升了模型稳定性与预测准确性,在复杂条件下有良好泛化能力。

力学与人工智能