音视频实时交互模型」共找到 1736 篇相关文章

产品应用7

震撼好莱坞,一天AI生成10部短片,Google神器比肩一个影视工作室

Google的AI视频神器Veo 3刷屏,使用门槛低,生成效率高,效果震撼。它能生成二次元、科幻、仙侠等多种类型短片,虽有不足,但极大促进AI视频发展,适合多行业基层人员。

鲸选AI
新闻资讯7

这事你还没注意呢,巨无霸已经完成“反超时刻”

过去 GPT 在 AI 领域一枝独秀,大家认为二三名与它有代际差距。但 Google 的 Gemini 2.5 Flash Image 发布后,其生图速度和质量提升,解决“连续性”问题,带来自然交互体验,标志 AI 进入新阶段。

MacTalk
开源动态8

空间智能卡脖子难题被杭州攻克!难倒GPT-5后,六小龙企业出手了

杭州群核科技发布空间大模型,深耕室内场景,直指‘空间一致性’痛点。其开源子模型具真实感全息漫游、可交互等特点。当前空间模型处早期,群核提出‘三位一体’战略,还将开源促行业发展。

量子位
产品应用7

字节悄咪咪上线了 AI 版抖音「随变」,在下什么棋?

临近春节,字节跳动 1 月初上线的「随变」App 在年轻人中流行。它类似「纯净版」AI 抖音,核心功能有 AI 形象生成等。字节借此在小体量社区验证功能,解决抖音年轻用户留存问题,也想抢占 AI 视频市场。

特工宇宙
新闻资讯7

突发!OpenAI关停Sora

OpenAI彻底退出视频生成业务,关闭App和API,ChatGPT视频功能也没了,迪士尼10亿美元合同作废。Sora研究团队转向机器人方向。原因是Anthropic靠文字和代码实现高营收,而Sora营收不佳且消耗算力。

AI寒武纪
产品应用8

“图片秒生”,腾讯混元图像2.0模型正式发布,主打速度和真实感

5月16日,腾讯发布混元图像2.0模型,率先实现实时生图,生图速度快、质量高,能避免‘AI味’。在GenEval基准上准确率超95%,还发布实时绘画板功能,后续将推原生多模态模型。

AI科技大本营
开源动态8

重磅!Meta开源通用神经输入系统!人人可用的非侵入式手环登场

Meta开源通用神经输入系统,用基于手腕的输入技术结合上下文感知AI带来新交互体验。关键技术EMG可读取大脑电信号,将其转成数字命令,系统表现优秀,为“隐形”人机交互奠基。

带你学AI
推荐文章7

人生周报v044:费曼

文章围绕AI应用展开,指出人机交互是AI应用竞争壁垒,介绍典型案例及交互形态,分析Agent不同场景,还提及AI应用创业要素,最后推荐《费曼经典:一个好奇者的探险人生》。

李继刚
算法论文8

Thinking with Video:一种全新的思考范式

在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。

深度学习自然语言处理
新闻资讯7

神秘模型屠榜多日、碾压Seedance 2.0!背后竟是阿里大招:新部门首作实锤,引爆股价拉升

近日,神秘模型 HappyHorse-1.0 登顶 Artificial Analysis 视频模型排行榜。4 月 10 日,阿里确认它是 ATH - AI 创新事业部自研产品,正在内测。该模型技术亮点多,若开源或使 AI 视频行业格局生变。

AI前线