实时数字人」共找到 1637 篇相关文章

开源动态8

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。

量子位
产品应用7

实时语音翻译

Sokuji 是跨平台桌面应用,用 OpenAI、Google Gemini 等 API 提供实时语音翻译。支持多系统,有桌面版和浏览器插件,适配会议场景,还具备音频可视化、虚拟音频设备等特色功能。

GitHubStore
算法论文8

让AI生成视频「又长又快」:Rolling Forcing实现分钟级实时生成

南洋理工大学与腾讯ARC实验室联合研究,由博士生刘坤昊等完成,提出Rolling Forcing方法,通过滚动窗口联合降噪等创新设计,突破实时长视频生成瓶颈,实现分钟级实时生成,还支持交互控制,但仍有优化方向。

机器之心
新闻资讯7

Kimi总裁张予彤北大实录:我们想要有抽象能力和偏执的|甲子光年

Kimi总裁张予彤在北大分享,谈AI时代才标准,偏好有抽象能力和偏执的。还探讨AI创造新工作、学校课程设计、企业管理等问题,分享Kimi招标准、组织特点及对行业诸多问题的看法。

甲子光年
新闻资讯8

Anthropic重磅新研究:当AI采访了1250,它看见了类的「职业软肋」

Anthropic推出Interviewer工具,与1250名职场、创作者、科学家深度对话,记录细节并量化。该工具能自动完成访谈、分析等流程,受访者满意度超97%。研究揭示不同职业对AI态度受职业结构等因素影响。

新智元
开源动态8

1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4对话自然切换!

在文本转语音(TTS)领域,生成长篇、多说话的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话,还具备高效处理长序列等亮点特性。

开源星探
开源动态8

让机器「秒懂话」!中国电信TeleAI发布首个实时文本驱动形机器控制框架TextOp

中国电信工智能研究院(TeleAI)具身智能团队推出形机器TextOp通用小脑,首创流式文本驱动的实时小脑控制范式。用户发文本指令,机器就能实时理解、无缝切换动作,在多场景有应用潜力。

机器之心
新闻资讯8

ChatGPT那一套要过时了?翁荔实测创业首个模型,回合制AI被“原生实时交互”秒了

Thinking Machines推出交互模型TML - Interaction - Small,可实时接收多模态输入并响应,性能超现有实时系统。该模型未开放,计划先有限预览再广泛发布,若开放将为企业带来巨大价值。

AI前线
新闻资讯8

全球AI失业大逃杀:25年已裁94000!微软高管:被裁可用AI管理情绪

2025年才过一半,全美科技行业已有94000被裁,微软又裁9000,Xbox高管竟建议被裁员工用AI疗伤。各科技公司为配合AI战略调整劳动力结构,多岗位面临被AI取代风险。

新智元
产品应用7

童年的滚球兽「走进」现实?华为天才少年创业,全球首个虚实融合的实时交互视频模型来了

Xmax AI 推出全球首个虚实融合实时交互视频模型 X1,通过手机摄像头实现虚拟与现实融合。它有四大玩法,操作简单。但面临多技术挑战,Xmax AI 团队实力强,给出硬核技术方案,愿景是让 AI 融入生活。

机器之心