实时语音转文字」共找到 566 篇相关文章

开源动态8

MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070即可实时运行

面壁智能联合多机构发布 MiniCPM-o 4.5 技术报告,公开 Omni-Flow 框架。该模型 9B 参数实现端到端全双工全模态,开放在线 Demo、API 等,最低 12GB 显存 GPU 可运行,在多维度评测表现出色。

AI科技评论
新闻资讯8

刚刚,Gemini 2.5系列模型更新,最新轻量版Flash-Lite竟能实时编写操作系统

谷歌更新Gemini 2.5系列模型,包括2.5 Pro和Flash稳定版及新推出的Flash-Lite预览版。谷歌CEO称Flash-Lite性价比高,适用于量大且注重成本的任务。报告还提及“智能体恐慌”现象。

机器之心
新闻资讯8

每秒生成超30帧视频,支持实时交互!自回归视频生成新框架刷新生成效率

微软研究院与北大联合发布Next - Frame Diffusion (NFD)新框架,通过帧内并行采样、帧间自回归等方式,让视频生成在保持高质量的同时,效率大幅提升,还采用多项技术进一步优化。

量子位
新闻资讯7

Meta CTO打脸扎克伯格:首秀翻车全因致命bug,AI智商捉急、语音交互全面崩盘

Meta Connect开发者大会上,Meta发布三款智能眼镜,现场演示却屡屡翻车。扎克伯格归咎于Wi-Fi,CTO Bosworth否认,称是资源管理失误和软件bug所致,但网友对此解释并不买账,质疑团队能力。

InfoQ
7

Meta CTO打脸扎克伯格:首秀翻车全因致命bug,AI智商捉急、语音交互全面崩盘

Meta Connect开发者大会上,Meta发布三款智能眼镜,现场演示却屡屡翻车。扎克伯格将问题归咎于Wi-Fi,CTO Bosworth否认,称是资源管理和软件错误。网友对Meta解释不满,质疑团队能力。

AI前线
算法论文8

破解在线长时序重建难题!纯视觉、单卡实时的公里级流式3D重建|CVPR'26

在自动驾驶等领域,长序列3D重建落地难,存在精度退化等问题。即将到来的CVPR 2026中,LongStream模型开源,它重新设计,解决了长序列难题,在多基准测试表现强,推动3D视觉走向在线建模。

量子位
产品应用7

重磅!谷歌开放世界模型Genie 3试用:AI实时生成可玩世界,人人都能创造“我的世界”

谷歌开放世界模型Genie 3实验性研究原型Project Genie试用,美国18岁以上Google AI Ultra订阅用户可体验,能创建、探索和重混互动世界,不过Genie 3是早期研究模型,有待改进之处。

AI寒武纪
开源动态8

中大 × MBZUAI重磅开源!A₁:全透明高效 VLA 模型,机器人实时控制成本直降 76% 丨CVPR 2026 Findings

开放世界机器人操作被大模型算力成本和推理延迟难题困住,中大与MBZUAI团队推出全开源的A₁模型,其自适应推理方案降低推理延迟和骨干计算量,性能超主流基线,打破‘高性能=高成本’魔咒。

AI科技评论
开源动态8

还在花钱转语音?10,000+ star 开源「ebook2audiobook」白嫖1107种语言!免费文字秒变多语言音频!

`ebook2audiobook` 是由 Drew Thomasson 主导、13k+ Stars 的开源工具,能将电子书无缝转换为有声书,支持 1107+ 语言,有章节拆分、多 TTS 引擎支持等功能,低门槛部署,适合多场景。

小华同学ai
开源动态8

登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界

全球科技界正豪赌「世界模型」,但主流模型多停留在「视觉生成」。中国影溯公司发布并开源世界模型 InSpatio - World,综合性能优异,以小博大登顶权威榜单,降低了物理世界数字化门槛,引发行业关注。

机器之心