「语音功能」共找到 1740 篇相关文章
剪辑 Agent 字幕升级:99% 正确率的字幕,一条指令直接推进剪映
作者成峰重做剪辑 Agent 字幕功能,结合 capcut - mate 项目,接入语音识别服务等优化流程。字幕准确率最高达 99%,还介绍了 5 步使用方法,解决非技术用户使用门槛问题。
干掉同传?谷歌把AI同传放入所有耳机,顺手发了个颠覆性的AI浏览器
Google加速将Gemini融入核心产品线,向Google翻译引入其能力,带来实时语音翻译Beta版,提升文本语境理解,扩展语言学习工具;还推出实验性浏览器Disco,用AI重构网页浏览体验。
刚刚开源的学术论文阅读神器,AI 驱动的个性化“暴躁教授”助你攻克论文!
学术论文阅读常因晦涩内容和语言壁垒让人望而却步。Mad-Professor是开源的AI驱动学术论文阅读工具,集成多种功能,通过AI问答和语音交互解答疑惑,赋予个性化角色,让阅读体验高效且生动。
可以用Claude Code来搞运维了
Claude Code刚发布后台任务功能,产品经理宣布它能处理长时间后台任务,不阻塞工作流程。有人将其变为全自动DevOps智能体用于运维,设置简单,还能语音播报、远程告警、自主诊断等。
The Batch: 936 |Claude Code 内部揭秘
广受欢迎的编码智能体Claude Code近期版本意外暴露底层代码。Anthropic称是人为失误,未泄露用户数据。工程师分析发现其架构似小型专用操作系统,还揭示了潜在功能和未来规划。
5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!
今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。
长视频会议纪要、访谈节目精剪AI神器
WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。
开源2天斩获3K标星!开源TTS新星Chatterbox盲测击败ElevenLabs!
文本转语音(TTS)技术发展快,但达顶尖水平仍有挑战。开源TTS新星Chatterbox,开源2天冲上GitHub热榜,星标超3K。它功能亮点多,安装简单,适用于多种场景,性能超ElevenLabs。
Claude code skills 怎么用来写作?
作者成峰分享用Claude Code的Skills功能写作的方法。先做写作准备,再用Skills辅助写作,介绍其优势、建立方法,最后排版发布。强调有效AI写作是让AI执行方法论,形成闭环。
为什么又是杭州?杭州初创团队打造全球第一个AI旅行伙伴
杭州初创团队打造的iMeanAI Coyage是全球首个AI旅行伙伴,能解决旅行规划中选择困难和信息过载问题,如订机票、酒店、行程,经测试表现出色,还将开放多语言语音导览功能。