语音记录」共找到 382 篇相关文章

开源动态8

具身智能从此「边听边说」,智源研究院开源原生全双工语音大模型RoboBrain-Audio

北京智源研究院联合多方发布原生全双工语音对话大模型 RoboBrain - Audio,采用新架构和创新训练范式,在性能上全面领先,革新音频 - 文本对齐方式,丰富了 RoboBrain 全栈体系,推动具身智能发展。

机器之心
开源动态8

2G 内存跑 Gemma 3n 完整版!全球首个 10B 内模型杀疯 LMArena:1300 分碾压记录

当地时间6月26日,谷歌正式发布Gemma 3n完整版,可在本地硬件运行。它是开源大模型,具多模态能力,最低2GB内存设备就能跑,E4B模型LMArena测评表现佳,还有MatFormer架构等多项创新。

AI前线
产品应用8

腾讯把这个 AI 产品做活了:两分钟一次按快门

作者分享使用腾讯会议AI纪要的体验,它每两分钟自动记录会议要点,还能捕捉气氛意图。会后可一键送进腾讯元宝追问,适配多样场景。此外,腾讯会议还有录制、语音转文字等功能,音效也有提升。

MacTalk
开源动态8

2.6K Star!超逼真端侧TTS模型,0.5B参数3秒音频即时克隆!

文章介绍开源项目NeuTTS Air,它是免费、轻量级超逼真语音合成模型,仅0.5B参数,媲美商用TTS引擎,能在低功耗设备运行,支持3秒音频克隆声音,还给出使用步骤和应用场景。

开源星探
开源动态8

开源真强大,不敢相信,太真实,揭秘8.3k star 开源神器 VoiceCraft 如何封神!!!

VoiceCraft 是多团队合作推出的零样本语音编辑与 TTS 开源项目。它能几秒克隆语音,实现编辑功能,支持零样本文本转语音,在真实场景音频中性能超 XTTS - v2、VALL‑E 等模型,解决了内容创作和编辑痛点。

小华同学ai
推荐文章7

百万人围观,「上下文图谱」火了,万亿美元新机遇?

本文围绕智能体对记录系统的影响展开讨论。有人认为智能体将摧毁记录系统,也有人反驳,指出其会提高记录系统标准。文章重点介绍上下文图谱概念,它是决策轨迹的长期积累,有望成万亿级新机遇。同时分析传统厂商构建难题及创业公司路径。

机器之心
开源动态8

17K+ star!ElevenLabs 超强平替,能克隆、能混音、能 API 调用!

ElevenLabs 效果好但价格贵且有隐私风险,现开源项目 Voicebox 是其免费替代。它本地优先运行,功能丰富,如语音克隆、文本转语音等,在 GitHub 收获 17.4K+ Star,适合多类用户。

开源先锋
产品应用8

刚刚,豆包「成精」了!一夜告别机械感,上亿人手机全量上线

字节跳动Seed团队发布原生全双工语音大模型Seeduplex,已在豆包App全量上线。它边听边说、懂思考停顿、抗干扰强,解决了精准抗干扰与动态判停难题,工程上也有突破,提升了交互体验。

新智元
开源动态8

最小模型仅 25MB,老设备无 GPU 也能流畅跑!

开源项目`KittenTTS`是文本转语音模型系列,核心特点是“小身材,大能量”。最小模型约1500万参数,体积25MB以内,无需GPU,靠CPU就能实现高质量语音合成,适合多种设备和场景。

开源先锋
产品应用8

阿里 Qwen3-TTS 全新上线!支持9种方言+49种音色,连天津味儿都拿捏了!

阿里通义团队上新 Qwen3-TTS 文本转语音模型,主打拟人语音表达、丰富音色体系与多语言多方言能力。有 49 种高保真音色,支持 10 种语言、9 种方言,还能智能调节语速和韵律。

开源星探