语音时长控制」共找到 1318 篇相关文章

产品应用7

Gemini 的 PPT 生成:使用技巧及模板提示词

Gemini APP 上线 PPT 生成能力,可通过提示词精细控制,还能与谷歌产品打通。文章介绍其使用方法,如开启 Canvas 模式、利用搜索填充内容等,还分享百搭 PPT 风格提示词。

歸藏的AI工具箱
开源动态8

17K+ star!ElevenLabs 超强平替,能克隆、能混音、能 API 调用!

ElevenLabs 效果好但价格贵且有隐私风险,现开源项目 Voicebox 是其免费替代。它本地优先运行,功能丰富,如语音克隆、文本转语音等,在 GitHub 收获 17.4K+ Star,适合多类用户。

开源先锋
算法论文8

豆包是如何炼成的?字节放出自研万卡训练系统ByteRobust论文

文章介绍字节跳动的LLM训练基础设施ByteRobust。它由控制和数据平面构成,关键目标是获高ETTR。该系统优先快速隔离故障、考量人为错误、控制恢复可变性,已部署超一年,效果显著。

机器之心
产品应用7

Claude Code也要龙虾化!凌晨床上发条消息,Mac Mini瞬间亮屏狂敲代码

Claude Code团队宣布新增Channels功能,可通过MCP控制会话,首批支持Telegram和Discord。用户能手机远程控制AI写代码,目前已灰度测试。不过其功能依赖会话存活,后续或接入更多平台。

新智元
新闻资讯8

独家对话大晓机器人陶大程:具身机器人大脑,不必装下整个世界|甲子光年

甲子光年独家对话大晓机器人陶大程,探讨具身机器人大脑。陶大程提出控制充分状态,大晓用Kairos模型回应世界模型问题,强调行动后果建模,还谈了数据处理、技术风险及应用场景等。

甲子光年
产品应用8

刚刚,豆包「成精」了!一夜告别机械感,上亿人手机全量上线

字节跳动Seed团队发布原生全双工语音大模型Seeduplex,已在豆包App全量上线。它边听边说、懂思考停顿、抗干扰强,解决了精准抗干扰与动态判停难题,工程上也有突破,提升了交互体验。

新智元
开源动态8

最小模型仅 25MB,老设备无 GPU 也能流畅跑!

开源项目`KittenTTS`是文本转语音模型系列,核心特点是“小身材,大能量”。最小模型约1500万参数,体积25MB以内,无需GPU,靠CPU就能实现高质量语音合成,适合多种设备和场景。

开源先锋
产品应用8

阿里 Qwen3-TTS 全新上线!支持9种方言+49种音色,连天津味儿都拿捏了!

阿里通义团队上新 Qwen3-TTS 文本转语音模型,主打拟人语音表达、丰富音色体系与多语言多方言能力。有 49 种高保真音色,支持 10 种语言、9 种方言,还能智能调节语速和韵律。

开源星探
新闻资讯7

熬夜后走神不是你的错,而是自救机制在“洗脑” | Nature

麻省理工学院研究揭示,熬夜后白天易走神是因大脑“洗脑”机制启动。正常“洗脑”在睡眠进行,清理废物;睡眠不足,白天也会启动,代价是注意力受损。此前波士顿大学也有大脑清洁相关研究。

量子位
算法论文8

大模型训练新突破!“不对称”训练让AI学会自我反思,推理零开销

字节团队提出全新语言模型训练方法PCL,首次打破训练与推理对称约束,实现‘训练-推理不对称’。在训练让模型反思评估结果,推理仅输出答案,零额外开销,显著提升模型能力。

量子位