「中文播客」共找到 304 篇相关文章
21.7K 标星的开源TTS!FishAudio开源情感语音核弹:200万小时炼成“声优AI”!
FishAudio团队推出新一代TTS语音模型OpenAudio S1,基于200万小时音频数据训练,采用Qwen3+Descript Audio Codec架构。它能实现情感表达,在TTS - Arena榜单登顶,还提供不同版本适配,适用场景广泛。
普利策得主万字起底奥特曼,Anthropic CEO:OpenAI问题就在他身上
《纽约客》万字长文将奥特曼推向信任审视。Ilya指控其说谎、操控他人,Anthropic CEO称他是OpenAI问题根源。回顾其经历,多位合作者与他分道扬镳,且OpenAI安全承诺缩水。
CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测
香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。
架构解耦是统一多模态模型所必须的吗?全新AIA损失:No
香港中文大学 MMLab 和美团研究者思考架构解耦是否为统一多模态模型必须,推出 AIA 损失。研究发现架构解耦未解决任务冲突,AIA 能提升模型性能,减少数据配比问题。
音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!
小米团队开源通用音频大模型MiMo-Audio,集多种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在多个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。
小红书最新开源TTS力作!4人对话自然无缝,毫秒极速响应!
近年来TTS技术爆发,但多人对话的自然流畅性和长序列稳定性一直是难点。小红书团队开源的FireRedTTS - 2是面向多人对话场景的TTS模型,实现自然切换和低延迟,支持多语言,适用于多种场景。
1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!
在文本转语音(TTS)领域,生成长篇、多说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。
Token,应该翻译成「新智元」
作者经信息论分析、构词法验证等,提议将Token中文标准译名定为「新智元」。现有译名如「托肯」「令牌」等都不满足要求,「新智元」能覆盖技术和经济属性,符合翻译学标准。
新手必备!Cursor 1.0 完全上手指南:从零开始用 AI 玩MCP
本文是Cursor 1.0的上手指南,涵盖下载安装、核心功能、中文环境设置、工作方式、MCP基础设置、AI使用方法及使用渠道等内容,助新手用AI玩MCP。
「重置之神」Tibo:Codex真的有一个「重置」按钮,实体的
OpenAI Codex产品负责人Tibo在播客透露重置按钮是实体。他谈了OpenAI文化、给创业者建议,还涉及AI开发流程、ChatGPT与Codex合并、额度重置原因等多方面内容。