「Seed - TTS - 2.0」共找到 2537 篇相关文章
GPT-Image-2平替!最强开源生图模型来了
OpenAI推出GPT Image 2引发AI生图大战,国内厂商商汤反击,推出多模态理解生成模型SenseNova U1并全面开源。它通过自研架构实现理解、推理、生成统一,实测表现惊艳,能力全维度,与GPT-Image-2范式不同。
春天见,第 20 届 D2 如期而至
2026年3月14日,第20届D2技术大会将在杭州阿里总部举办,主题为「AI新」。大会设多场专场沙龙,涵盖AI写代码、改变体验等内容,还有夜场沙龙探讨终端与AI未来。此外,开放议题征集,公布了参会购票信息。
Sora 2 App 上手体验攻略,附Sora AI视频
本文是Sora 2 App上手体验攻略。Sora 2 PC版能依提示词生成精美电影感视频,还可创建虚拟形象;App交互似抖音,能录制上传自身形象生成视频。其生成视频镜头自然,有“AI导演感”,但目前时长较短。
火速吃瓜:Kimi K2.6设计能力超越Claude Design
Claude Design刚冲击设计行业,就被中国的Kimi K2.6反超。Kimi K2.6设计能力强,价格比Claude Design便宜7倍,且“设计”只是副业。Anthropic拉软件大佬组联盟反击,胜负待察。
陶哲轩盖章!GPT-5.2杀疯了,我们终将沦为「硅基帕鲁」
币圈玩家Neel Somani用GPT - 5.2 Pro攻克数学难题,陶哲轩盖章确认。但此成功背后是极低的通过率,靠Aristotle工具筛选。人类数学家或转向定义问题,数学美感可能丧失。
智能体A2A落地华为新旗舰,鸿蒙开发者新机遇来了
华为Mate80系列、MateX7发布会上展示,搭载鸿蒙6的Mate X7实现Agent to Agent智能体协作商用落地。HarmonyOS 6重构应用连接方式,A2A协作带来效率革命,为开发者提供新机遇。
LTX-2开源:首个能同时生成视频和音频的模型
LTX-2开源,它是Lightricks团队开发的首个开源多模态基础模型,能联合生成音频和视频。采用非对称双流扩散变换器架构,用深度多语言文本编码器,速度比许多纯视频开源模型快,让模型理解声画关联。
刚开源的口袋级TTS,CPU 即可多语言本地畅用,爽!
传统TTS模型对个人开发者和边缘设备不友好,最近Github上开源的Pocket - TTS仅100M参数,能在普通CPU上超实时语音合成,支持语音克隆,安装简单,适合多种本地语音开发场景。
Cursor Composer 2.5 拆解:最强大的 RL 环境,就是你自己的产品
今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强大的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。
连续自回归的dots.tts:小红书开源语音合成模型「基座」
语音合成赛道发展如早期大语言模型,路线未收敛。小红书与上海交通大学合作开源的 dots.tts,是 20 亿参数、全连续、端到端自回归 TTS 基础模型,有准确度高、可扩展等特点,还开源了代码。