实时互动」共找到 481 篇相关文章

产品应用8

24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业三堵墙

虎牙推出实时多模态数字人VAM 1.0,只需一张照片就能转化成能说会唱、可实时互动的数字人。它解决了AI数字人行业的时间、交互、部署三堵墙,稳定性、交互精度和响应速度表现出色,应用场景广泛。

量子位
开源动态7

马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一

实时视频世界模型成热门,Loopit发布的实时互动世界模型Zing - 0.5在评测中获第一且已开源。该公司提出独特观点,认为实时视频非世界,互动应“模应一体”,还指出抵达端到端终局的新路径。

新智元
新闻资讯8

豆包19亿次互动背后的技术真相:春晚级体验是如何炼成的?

2026 年春晚 AI 元素亮眼,豆包 AI 互动达 19 亿次。火山引擎作为独家 AI 云合作伙伴,用智能视频云等技术打造节目效果,解决视频画质、空间逻辑、机器人互动延迟等难题,还保障全民互动实时字幕。

InfoQ
产品应用8

Sora2不够香了!这款国产AI视频模型已经能边看边生成,生成快还互动

国内AI视频玩家弯道超车,百度蒸汽机(文心专精版)开卷实时流式生成。它能边看边生成,生成快还互动佳,实现生成迅速、实时交互、无限续写,重新定义AI视频生成领域。

量子位
开源动态8

完全离线!开源实时语音识别神器,本地实时语音转文字,秒级延迟+说话人识别!

实时语音转文字和说话人识别需求渐长,但传统工具多依赖云端,有隐私与延迟问题。GitHub上的开源项目WhisperLiveKit是本地化语音识别方案,速度快、延迟低、支持说话人识别,适合会议等场景。

开源星探
算法论文7

实时生成视频!StreamDiT每秒16帧,单卡生成

现有文本生成视频模型多为离线生成,无法满足实时交互需求。加利福尼亚大学与Meta联合提出StreamDiT模型,采用流匹配等方法,蒸馏模型可单卡每秒16帧实时生成512p视频,不过仍有伪影问题。

带你学AI
开源动态7

AI驱动的实时全球情报情报系统,绝大多信息免费!覆盖全球实时情报的多个维度!

实时全球情报仪表盘是AI驱动的态势感知界面,集成新闻聚合、地缘政治监测与基础设施追踪。数据源多为免费公开API,低延迟更新。有多种功能,技术栈丰富,聚合多领域65+外部数据源。

GitHubStore
产品应用7

理解归 AI,正确归引擎:从一句话到一条实时数据链路(0代码搭建实时任务)

文章分享直播数据团队搭建AI辅助、指标驱动的实时数据端到端开发系统的实践与思考。从案例介绍用户使用流程,再深入系统内部讲链路构建与演进,阐述设计方法论,最后提出未来规划。

阿里云开发者
产品应用7

谷歌翻译新功能上线 iOS:支持任意耳机,实时听懂70+语言

谷歌翻译耳机实时翻译功能正式登陆 iOS,在 iOS 和 Android 端覆盖范围扩大,新增多国市场,支持超 70 种语言。打开 App 连接耳机即可实时听懂对方说话,适用于家庭和出行场景。

AI寒武纪
产品应用8

实测腾讯Hunyuan-Image2.0,首个毫秒级实时图像生成模型

今天上午腾讯发布混元图像2.0,以“更智能、更开放、更中国”为理念。其参数规模提升,推理时间大幅压缩,实现毫秒级实时生成,还在画面质量等方面升级,新增实时绘画板功能。

带你学AI
上一页1 / 49下一页