「语音转文字模型」共找到 255 篇相关文章
3 个月达成 5 亿平台播放量,Wispr Flow 分享如何做好红人营销
Wispr Flow是语音输入法中出圈且具代表性的产品,增长快、付费强、使用频。其靠红人营销3个月在两平台获超5亿播放量。19岁实习生分享经验,涵盖招人、判断品味、分层管理等方面。
“被投资人怒怼30分钟后,我更确定中国To B的答案” | 甲子光年
文章讲述百融云创在AI To B领域的探索。它突破传统“卖工具”模式,采用“结果计价”,共担结果、承包KPI。技术上提前押注语音对话技术栈,“硅基员工”概念落地多场景,有望推动中国To B行业进入新秩序。
比NotebookLM更好的「开源播客」,可根据多模态内容生成30分钟以上播客音频。
Podcastfy是开源Python工具,能把文本、图片等多模态内容,借生成式AI转化为播客。它支持自定义,适配多种语言和文本转语音模型,能生成2 - 5分钟或30分钟以上的播客,使用体验比NotebookLM好。
Soul App 又放大招!把 42000 小时数据喂出的“歌神” SoulX-Singer 开源了!
语音合成近年爆发式增长,开源领域也有强大音乐模型。Soul APP联合多机构开源的SoulX - Singer,喂了42000小时数据,主打零样本歌声合成,支持双控制方式,多语言与跨语言能力强,架构先进,评测表现优。
真·全民AI健康管家来了!实测蚂蚁AQ:追问识药看皮肤,还能连医院接硬件
蚂蚁上线AI健康管家APP——AQ,有超百项AI功能,连接超5000家医院、近百万医生等。它能追问识药看皮肤,打通硬件,设语音通话。凭借技术和生态优势,实现从技术工具到健康管家的跃迁。
本周推荐的6个超级6的Github开源项目!
本文推荐6个GitHub开源项目。如WeClone用微信记录定制数字分身、支持语音克隆;Windmill将脚本转工作流和UI;Zed是高性能Rust代码编辑器;webfunny_monitor监控前端性能;Rybbit分析网站流量;Lite XL是轻量级文本编辑器。
一键实现PPT演讲自由!「解说音频+视频」同步生成,效果逼近真人
澳大利亚与英国研究人员提出文档到演示视频生成任务,推出PresentAgent系统。它能将长文档转为带语音和同步幻灯片的视频,流程可控且适应多领域。实验显示其生成视频接近人类表现,还设计了双路径评估策略。
豆包 Seed 2.0 Lite升级:给 Agent 装上眼睛和耳朵
近期模型发布竞争激烈,作者做视频字幕常遇识别错误,因语音识别工具缺上下文。字节方舟的豆包 Seed 2.0 Lite 升级后能听,还可结合上下文准确输出字幕,成本降 20%,也能理解视频,为工作流补全感知。
老黄亲自站台,英伟达编程神器!Cursor 2.0自研模型狂飙4倍
Cursor 2.0版本重大升级,发布自研编码模型Composer,速度是同等模型4倍。还重构IDE交互逻辑,支持多智能体模式,引入语音模式等。早期测试和开发者反馈其速度快,但智能程度与部分模型有差距。
13年死磕一个真理,这家中国AI黑马冲刺IPO
云知声深耕AI 13年,即将冲刺港交所IPO。它从单一语音识别发展为全栈AGI方案商,以智慧生活和智能医疗双轮驱动,营收稳健增长。其坚持技术创新,构建全栈自研体系,有望在AI时代持续领跑。