端到端语音模型」共找到 8012 篇相关文章

新闻资讯7

翁荔创业大模型首秀!告别“120亿美元估值0模型

Thinking Machines Lab发布首个模型TML - Interaction - Small,联合创始人翁荔演示。该模型让实时交互成原生能力,响应延迟比GPT - realtime - 2.0快4倍,解决了多数AI“回合制”问题,还介绍了实现机制和公司过往情况。

量子位
开源动态7

最强DeepResearch!通义DeepResearch-30B开源实战:模型部署+LangGraph+A2A全攻略

阿里发布全开源项目通义DeepResearch,在研究任务评测中表现出色,底层是30B的MoE专用推理模型,资源需求低。文章演示了基于该项目构建本地化DeepResearch助理的方法,包括模型部署、Agent实现等。

AI大模型应用实践
算法论文8

AGI真方向?谷歌证明:智能体在自研世界模型,世界模型is all You Need

谷歌DeepMind研究人员表明,通用AI智能体处理复杂长期任务需学习内部世界模型,还证明可从智能体策略提取该模型。此研究成果补充多领域,对AI发展和安全意义重大。

机器之心
开源动态8

模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南

Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。

AIGC开放社区
产品应用8

九天大模型大变身:性能狂飙35%!还能一键P大象

7月26日,中国移动在2025世界人工智能大会发布「九天」基础大模型3.0,技术全面升级,复杂推理能力提升35%,智能体调用效率提升21%,还推出代码、数学等专项大模型,多模态能力也焕新。

新智元
算法论文8

用155万模拟视频给模型上课!GVE模型一次学会9种视频检索技能

当前视频检索研究陷入困境,现有模型难以应对复杂检索需求。香港科技大学(广州)联合阿里巴巴通义实验室推出通用视频嵌入模型GVE,其在零样本设置下超越14个主流模型,全链条创新为视频检索通用化奠定基础。

量子位
算法论文8

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能开发游戏,Claude Opus 四成达到可玩水平

香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。

AI科技评论
算法论文8

天下苦VAE久矣:阿里高德提出像素空间生成模型训练范式, 彻底告别VAE依赖

当前主流图像生成技术训练范式依赖VAE,带来训练复杂、微调成本高的问题。阿里高德提出EPG,结合自监督预训练与微调,去除对VAE依赖,在训练效率和生成效果上有突破。

量子位
开源动态8

告别天价API账单!开源Chatterbox语音服务器上线,隐私与效率双赢!

第三方语音合成API成本高、有隐私风险,直接部署开源模型配置复杂。开源的Chatterbox-TTS-Server基于Chatterbox TTS模型,有Web界面、声音克隆等功能,支持GPU和Docker,可解决部署难题。

开源星探
开源动态7

马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一

实时视频世界模型成热门,Loopit发布的实时互动世界模型Zing - 0.5在评测中获第一且已开源。该公司提出独特观点,认为实时视频非世界,互动应“模应一体”,还指出抵达终局的新路径。

新智元