多模态语音理解大模型」共找到 1763 篇相关文章

产品应用8

“图片秒生”,腾讯混元图像2.0模型正式发布,主打速度和真实感

5月16日,腾讯发布混元图像2.0模型,率先实现实时生图,生图速度快、质量高,能避免‘AI味’。在GenEval基准上准确率超95%,还发布实时绘画板功能,后续将推原生多模态模型。

AI科技大本营
推荐文章7

GAN之父Ian Goodfellow病后归来,剑指高效世界模型

GAN之父Ian Goodfellow等提出,利用符号化表示和游戏虚拟世界数据,或为构建动作条件多模态世界模型最佳路径,该模型可支持长时序任务预测与规划,还探讨构建原因、数据来源等。

机器之心
开源动态8

最强开源VLM“华山论剑”丨多模态专场直播

近期Intern - S1等多模态大模型开源,引发热烈讨论。本周四OpenMMLab等发起AI Insight多模态专场,邀请模型核心研发者分享,涵盖模型设计思路、实践经验等,还有圆桌对谈。

OpenMMLab
开源动态8

17K+ star!ElevenLabs 超强平替,能克隆、能混音、能 API 调用!

ElevenLabs 效果好但价格贵且有隐私风险,现开源项目 Voicebox 是其免费替代。它本地优先运行,功能丰富,如语音克隆、文本转语音等,在 GitHub 收获 17.4K+ Star,适合多类用户。

开源先锋
推荐文章8

商汤林达华万字长文回答AGI:4层破壁,3大挑战

在WAIC 2025上,商汤发布国内首个实现“图文交错思维”的商业级大模型日日新6.5。商汤科技联合创始人林达华发文,剖析多模态通用智能实践,解答AI领域关键问题,提供通往AGI的参考。

量子位
产品应用8

刚刚,豆包「成精」了!一夜告别机械感,上亿人手机全量上线

字节跳动Seed团队发布原生全双工语音大模型Seeduplex,已在豆包App全量上线。它边听边说、懂思考停顿、抗干扰强,解决了精准抗干扰与动态判停难题,工程上也有突破,提升了交互体验。

新智元
开源动态8

最小模型仅 25MB,老设备无 GPU 也能流畅跑!

开源项目`KittenTTS`是文本转语音模型系列,核心特点是“小身材,大能量”。最小模型约1500万参数,体积25MB以内,无需GPU,靠CPU就能实现高质量语音合成,适合多种设备和场景。

开源先锋
产品应用8

阿里 Qwen3-TTS 全新上线!支持9种方言+49种音色,连天津味儿都拿捏了!

阿里通义团队上新 Qwen3-TTS 文本转语音模型,主打拟人语音表达、丰富音色体系与多语言多方言能力。有 49 种高保真音色,支持 10 种语言、9 种方言,还能智能调节语速和韵律。

开源星探
推荐文章7

统一框架下的具身多模态推理:自变量机器人让AI放下海德格尔的锤子

当前先进机器人无法像人类自如用工具,现有多模态系统有局限。自变量机器人提出端到端统一架构,以统一表示学习和多任务多模态生成解锁具身多模态推理能力,实现范式转换。

机器之心
新闻资讯7

独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人

9月3日消息,原DeepSeek核心研究员魏浩然带队转入百度,任文心大模型多模态算法负责人。此前他在多模态与端到端OCR底层重构有突出成绩,这是百度布局青年顶尖研发人才的又一动作。

AI前线