「全双工语音交互」共找到 815 篇相关文章
MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070即可实时运行
面壁智能联合多机构发布 MiniCPM-o 4.5 技术报告,公开 Omni-Flow 框架。该模型 9B 参数实现端到端全双工全模态,开放在线 Demo、API 等,最低 12GB 显存 GPU 可运行,在多维度评测表现出色。
小米语音首席科学家:AI发展的本质就像生物进化,不开源要慢1000倍 | MEET2026
小米语音首席科学家Daniel Povey在量子位MEET2026大会提出,AI发展像生物进化,是不断试错过程,开源是核心加速器,没开源行业进化或慢千倍,大公司应“两条腿走路”。
中国电信天翼AI发布首款AI眼镜,星辰大模型开启第一视角智能交互新时代
在2025世界人工智能大会上,中国电信天翼AI发布全球首款融合自研“星辰大模型”的智能穿戴设备——天翼AI智能眼镜,依托云网融合与星辰大模型,开创第一视角智能交互新范式。
ICML 2025 Spotlight | 快手、南开联合提出模块化双工注意力机制,显著提升多模态大模型情感理解能力!
情智兼备是人工智能发展方向,但多模态情感数据语义复杂,建模跨模态关联是挑战。快手可灵团队与南开提出模块化双工注意力范式,构建‘摩达’模型,在多任务测试中性能提升,成果被 ICML 2025 收录。
断网可用!首款全双工全模态大模型技术报告发布,附一键安装包
面壁智能等联合发布MiniCPM-o 4.5技术报告,它是业界首个端到端全双工全模态大模型,采用Omni - Flow架构。同步推出在线Demo、API、端侧安装包等,低显存GPU即可运行,性能表现优秀,应用潜力大。
小说一键转有声剧!豆包语音团队提出「AI多人有声剧」方案,沉浸感拉满了
豆包语音团队发布「AI 多人有声剧」自动化方案,基于多角色 Seed - TTS - 2.0 模型,实现从小说文本到有声剧成品端到端 AI 制作,成本和周期大降,首批有声剧已在番茄小说 App 上线。
ChatGPT那一套要过时了?翁荔实测创业首个模型,回合制AI被“原生实时交互”秒了
Thinking Machines推出交互模型TML - Interaction - Small,可实时接收多模态输入并响应,性能超现有实时系统。该模型未开放,计划先有限预览再广泛发布,若开放将为企业带来巨大价值。
狂涨10.3K star!最近爆火的微信记录训练专属数字分身,支持语音克隆,绝了!
在AI大模型时代,大家想让模型更个性化。最近GitHub爆火的开源项目`WeClone`,用微信聊天记录训练专属AI打造数字分身,还能语音克隆。它全链路覆盖、支持多模型,有隐私保护等特色,操作也有介绍。
开源播客TTS神器!高效TTS模型:Muyan-TTS,0.33秒生成1秒音频,零样本语音合成!
介绍新发布的开源TTS模型Muyan - TTS,它专为播客场景设计,以超低延迟实现零样本语音合成,预训练大量播客数据,支持长内容连贯生成,还介绍了使用步骤、适用场景等。
语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究
清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。