「长语音」共找到 864 篇相关文章
可从表复杂文档中提取结构化数据的Python库agentic-doc,支持100+页PDF长文档
LandingAI的Agentic文档提取API可从复杂文档提取结构化数据,Python库agentic-doc封装该API,支持100+页PDF长文档,有自动重试、并行处理等功能,还能可视化调试。
32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成
字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。
8B模型可以超过GPT-4o!并行KV Cache压缩支持的128K长度外推方法ParallelComp
大模型长文本推理存在瓶颈,作者提出 ParallelComp 方案。它有并行 Attention 分块、KV 缓存智能淘汰与注意力偏差校准三大创新,能让 8B 模型性能达 GPT - 4o 的 91.17%,特定任务超 GPT - 4o。
B站下场自研AI配音!纯正美音版甄嬛传流出,再不用看小红书学英语了(Doge)
B站发布TTS模型IndexTTS2,亮点是实现时长控制时再现符合Prompt的情感特征,支持两种生成方式,经测试多项指标达SOTA。它由三核心模块组成,还可能是代号H的AI创作工具一环。
一键实现PPT演讲自由!「解说音频+视频」同步生成,效果逼近真人
澳大利亚与英国研究人员提出文档到演示视频生成任务,推出PresentAgent系统。它能将长文档转为带语音和同步幻灯片的视频,流程可控且适应多领域。实验显示其生成视频接近人类表现,还设计了双路径评估策略。
太逼真!豆包·播客模型来了:一句话生成「苏超联赛」播客,很懂13太保的梗
火山引擎发布豆包·播客模型,生成的AI对话语气、停顿等像真人。操作简单,生成快且有字幕。能处理多种类型内容,如热搜话题、苏超联赛、超长文本等。其基于端到端实时语音模型,有技术突破。
Sora2还在5秒打转,字节AI生视频已经4分钟“起飞”
字节和UCLA联合提出Self - Forcing++方法,无需更换模型架构或重收集数据集,就能生成分钟级长视频,最长达4分15秒,高质量且开源,在长、短时长生成上性能领先。
ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE
长文本能力对语言模型重要,但现有模型训练窗长有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升长文本泛化能力,实验表现超RoPE。
2.6K Star!超逼真端侧TTS模型,0.5B参数3秒音频即时克隆!
文章介绍开源项目NeuTTS Air,它是免费、轻量级超逼真语音合成模型,仅0.5B参数,媲美商用TTS引擎,能在低功耗设备运行,支持3秒音频克隆声音,还给出使用步骤和应用场景。
开源真强大,不敢相信,太真实,揭秘8.3k star 开源神器 VoiceCraft 如何封神!!!
VoiceCraft 是多团队合作推出的零样本语音编辑与 TTS 开源项目。它能几秒克隆语音,实现编辑功能,支持零样本文本转语音,在真实场景音频中性能超 XTTS - v2、VALL‑E 等模型,解决了内容创作和编辑痛点。