第一视角视频问答」共找到 1415 篇相关文章

推荐文章7

快手高欢深度解读:多模态理解如何成为AIGC视频生成的“幕后功臣”?

2024 年 AIGC 爆发,多模态理解技术支撑 AIGC 原生应用。快手高欢在 AICon 大会分享多模态理解在 AIGC 场景应用,介绍主流 AIGC 产品形态,探讨其背后多模态理解方法、提升能力途径及赋能 AIGC 的方向。

InfoQ
开源动态8

比SOTA快9倍,谷歌DeepMind时空重建,把视频变成时空搜索引擎

谷歌DeepMind联合团队发布D4RT时空重建框架,颠覆传统视频转3D方法。它按需提问,像搜索引擎,处理动态视频高效。内部结构分编码、解码两步,速度快,还发明聪明收割机算法,在多项测试中表现优异。

AIGC开放社区
算法论文8

TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法

北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。

机器之心
推荐文章8

当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?

在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。

海外独角兽
开源动态8

中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

近日,中国科学院等全球顶尖机构发布手术视频原生基础模型SurgMotion。它依托全球最大手术视频数据集,首次突破十亿级参数,覆盖17项核心手术任务,性能卓越,还在多领域形成生态共鸣。

机器之心
新闻资讯8

神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光

神秘具身团队放出一连串Demo视频,其内部代号“MVP”的模型让机器人似人般思考决策。视频展示机器人在不同场景下的表现,如躲避推搡、做家务、机器人协作、高效收纳等,体现对物理规则和人类习惯的理解与自进化能力。

量子位
新闻资讯8

从被100家VC拒绝到英伟达、字节抢着投,AI视频独角兽CEO揭秘“奇葩”用人哲学:不招精英

Synthesia是专注企业级AI视频方案的平台,愿景是让会用PPT的人轻松做视频。创业初被100位投资者拒绝,获Mark Cuban支持后走上正轨。产品受众多公司使用,ARR破1亿美元,还获英伟达、字节等投资,CEO用人不招精英。

AI前线
算法论文8

真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试

浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。

新智元
产品应用8

MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV

上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。

AIGC开放社区
新闻资讯8

马斯克还在卷10秒,中国AI直接掀桌!16秒一镜到底,全球唯二

2026年AI视频圈竞争激烈,硅谷巨头激战正酣,马斯克Grok Imagine上线生成10s视频功能。在此背景下,中国AI的Vidu Q3登场,16s音画直出一镜到底,还支持多种功能,位列中国第一、全球第二。

新智元