语音时长控制」共找到 1318 篇相关文章

产品应用7

WorkBuddy上线远程控制,国内也有了最丝滑的Agent工作方式。

WorkBuddy更新远程控制功能,因国内直连,体验比Codex还好。其打通PC、App和小程序,实同步电脑内容。还新增资料库等实用功能,让国内用户有更丝滑的Agent工作方式。

数字生命卡兹克
开源动态8

告别天价API账单!开源Chatterbox语音服务器上线,隐私与效率双赢!

第三方语音合成API成本高、有隐私风险,直接部署开源模型配置复杂。开源的Chatterbox-TTS-Server基于Chatterbox TTS模型,有Web界面、声音克隆等功能,支持GPU和Docker,可解决部署难题。

开源星探
开源动态7

Hermes Agent 发布更新 Herald:实语音 + Agent 之间可以互相通信了

Hermes Agent 更新到 v0.20.0 代号 Herald,增加实语音对话与唤醒词,可验证引用来源可信度,集成签名Webhook,支持代理到代理协议,还有性能与安全方面更新,顺应新 Agent 发展趋势。

AI工程化
产品应用7

Claude Code 新增 /btw 功能:让你在 AI 干活「插嘴」提问

Anthropic工程师Thariq宣布Claude Code新增`/btw`命令,支持在其执行任务开启「旁路对话」。该功能不打断任务、不污染主对话历史,能解决提问痛点,反映AI编码工具走向「持续协作」趋势。

AGI Hunt
产品应用7

估值 20 亿美元的语音输入法,开源平替已经 3 万 star

文章指出语音输入随着 AI 发展价值重估,介绍了开源工具 OpenLess,分析了商业订阅、开源桌面工具、大厂输入法三类玩家,给出四层评估框架,也提及开源风险,并对不同需求给出选择建议。

AI Reading Hub
算法论文8

说句话就能飞!北航发布语言交互的无人机控制模型

北航刘偲教授团队提出语言引导的细粒度无人机轨迹控制研究框架,定义Flow范式。采用模仿学习法让无人机响应指令,构建数据集和仿真评测基准,还提出协作策略和算法,实现真机部署。

量子位
算法论文8

谢赛宁团队新作:不用提示词精准实现3D画面控制

谢赛宁团队新发布的Blender Fusion框架,结合图形工具 (Blender) 与扩散模型,让视觉合成不再仅依赖文本提示,实现精准画面控制。其核心是对现有技术高效组合,还透露两项训练技巧提升泛化性。

量子位
产品应用8

132万字实字幕!阿里语音模型支持影视飓风100小直播

阿里升级实语音识别大模型Fun-ASR-Realtime,首字延迟在百毫秒级别、识别准确率接近离线模型。在影视飓风100小直播中表现出色,还支持16种方言和30种语言,离线模型Fun-ASR-Flash全球权威榜单排第一。

千问大模型
推荐文章8

一篇讲透Agent自进化飞轮怎么搭:评测→记忆→落地→控制

文章指出多数团队评测、记忆、Self - Improve 拆分做,飞轮难转,原因是环节衔接断链。基于行业研究及实践,提炼评测→记忆→落地→控制四齿飞轮方法论,阐述各环节核心矛盾、建设要点、避坑指南及咬合形成飞轮的方法。

腾讯技术工程
产品应用7

突破视频长限制!Manus上架视频生成功能,网友:比Sora更好

Manus上架视频生成功能,可通过连续拼接突破长限制。它按“拍电影”方式,根据提示词生成片段再合成故事。网友评价是新创作方式,但效果有提升空间,部分人认为比Sora好。

量子位