「语音输入工具」共找到 2293 篇相关文章
爆火开源!让《魔兽争霸》里的牛马Peon提醒你氛围编程状态,开发效率提高50%
peon - ping是Agent专用开源通知工具,可在多种AI编程环境监听关键事件,通过游戏角色语音、桌面横幅等提醒开发者。还支持MCP、手机推送,有提醒运动附加功能,提升AI编程体验。
实测 MiniMax H3:开源“斩杀线”蔓延到视频模型圈
本文实测 MiniMax H3 视频模型,它 8 月 3 日开源,成本低至 0.5 元/秒,在编辑榜成绩佳。它定位全模态生成,能多素材输入。实测效果好,价格约为 Seedance 2.5 的三分之一,还支持原生剪辑,适配多芯片与工具。
视频进入可编辑时代:藏师傅教你视频版 Banana 可灵 O1
可灵发布大一统视频、图像生成和编辑工具 O1,支持在一个界面完成视频图片编辑生成。此次更新统一多模态视频大模型,支持多模态输入,有诸多新特性,还支持自由选择视频生成时长和风格转换等。
人类造工具200万年,工具开始研究工具!97年天才少年带队,把“AI寻找研究方向”做成了现实
2026年AI开始研究AI(AI4AI),深圳EvoMap团队用蜂群协作做出产品EvoX。他们创新Agent组织方式,有实验数据支撑其效果,还开源成果AutoResearch解决AI痛点,在生活场景优化旧算法可行。
2.6K Star!超逼真端侧TTS模型,0.5B参数3秒音频即时克隆!
文章介绍开源项目NeuTTS Air,它是免费、轻量级超逼真语音合成模型,仅0.5B参数,媲美商用TTS引擎,能在低功耗设备运行,支持3秒音频克隆声音,还给出使用步骤和应用场景。
能导出 PSD 的 AI 设计工具,出现了
国内 Seede AI 团队发布海外新产品,无需写咒语,填文案信息就能让 AI 搞定排版等。它生成可编辑源文件,适合有内容但不会设计的人,还支持多格式导出,不过不擅长创意生图。
OpenAI 详解规模化低延迟语音 AI 的 WebRTC 架构
OpenAI 介绍为全球规模低延迟语音 AI 调整 WebRTC 架构,将传统媒体终结模型换为中继收发器架构,分离职责,避免复杂逻辑堆砌与转嫁。此架构为实时语音技术布局补充基础设施细节,对架构师有参考价值。
面壁小钢炮 VoxCPM-TTS:开源端到端 TTS,轻量高效低延迟
面壁提出基于扩散自回归建模的端到端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。
LLM遇上表格:4类表示、5大任务、3大机会
文章指出LLM处理表格有任务单一、输入复杂易崩、表示不统一痛点,介绍4种表格输入表示法、5大任务,还发现任务复杂度、输入复杂度及表示统一方面存在新研究机会。
终于等到你!阿里上线全新免费AI IDE工具——通义灵码
今年AI行业卷AI Agent和AI Coding领域,都在推自家IDE。阿里有Qwen3加持,现发布全新免费AI IDE工具通义灵码。该工具具备内置Qwen3、MCP支持等特点,还有NES智能修改预测等功能。