语音基准」共找到 1125 篇相关文章

产品应用8

小说一键转有声剧!豆包语音团队提出「AI多人有声剧」方案,沉浸感拉满了

豆包语音团队发布「AI 多人有声剧」自动化方案,基于多角色 Seed - TTS - 2.0 模型,实现从小说文本到有声剧成品端到端 AI 制作,成本和周期大降,首批有声剧已在番茄小说 App 上线。

机器之心
算法论文8

HaluMem:让AI记忆系统的“幻觉”现形——首个面向记忆系统的操作级幻觉评测基准

过去一年,AI Agent的‘记忆能力’成热门话题,但AI记忆存在幻觉问题。为此发布操作级幻觉评估基准HaluMem,它能精准定位幻觉来源,评估主流记忆系统,为构建可靠记忆系统提供方向。

PaperAgent
算法论文8

横扫八大数学竞赛:清华微软联合提出STAR-PólyaMath,Apex基准超GPT-5.5 13.5%

清华大学与微软亚洲研究院团队提出推理多智能体系统 STAR - PólyaMath,构建探索 - 推理 - 验证框架,解决大模型长程数学推理瓶颈,在八大数学竞赛基准获最优成绩,还可泛化到其他推理场景。

机器之心
开源动态8

狂涨10.3K star!最近爆火的微信记录训练专属数字分身,支持语音克隆,绝了!

在AI大模型时代,大家想让模型更个性化。最近GitHub爆火的开源项目`WeClone`,用微信聊天记录训练专属AI打造数字分身,还能语音克隆。它全链路覆盖、支持多模型,有隐私保护等特色,操作也有介绍。

开源先锋
开源动态7

开源播客TTS神器!高效TTS模型:Muyan-TTS,0.33秒生成1秒音频,零样本语音合成!

介绍新发布的开源TTS模型Muyan - TTS,它专为播客场景设计,以超低延迟实现零样本语音合成,预训练大量播客数据,支持长内容连贯生成,还介绍了使用步骤、适用场景等。

开源星探
算法论文8

语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究

清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。

机器之心
算法论文8

超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试

加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。

量子位
算法论文8

5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙大&成电&港中文

当前视觉语言大模型空间信息学习片段化,缺乏多维度空间推理能力。浙大、成电和港中文团队提出ViewSpatial - Bench基准体系,评估主流模型,揭示其缺陷,并开发MVSM优化跨视角空间理解。

量子位
开源动态8

马斯克转发字节Seed&哥大商学院新基准:大模型搞金融,连查个股价都能出错

字节跳动Seed团队与哥大商学院推出开源金融搜索与推理基准测试FinSearchComp,含635个问题。评测显示大模型处理金融任务有差距,凸显金融AI能力评估重要性,还揭示了关键能力差距。

量子位
算法论文8

面对无解问题大模型竟会崩溃?港中文&华为联合提出首个大模型推理可靠性评估基准

港中文和华为诺亚实验室联合提出ReliableMath基准,探究大模型推理可靠性。提出评估准则,构建含可解与不可解问题的ReliableMath数据集,实验揭示大模型缺陷,还提出提高可靠性的对齐策略。

机器之心