视频语义搜索」共找到 1515 篇相关文章

产品应用7

实测Gemini图片转视频新功能,终于蹲到经典梗图后续了(doge)

Gemini接入带声音的图片转视频功能,作者实测该功能。用开盒指令测试,生成速度较快;还尝试给梗图加后续,发现生成精确内容需详细提示词,且不能生成具体真人形象内容。

量子位
算法论文8

无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention

高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。

机器之心
开源动态8

ICLR 2026|滑铁卢大学联合可灵提出UniVideo:统一视频理解、生成、编辑多模态

滑铁卢大学与快手可灵团队提出 UniVideo,是支持视频理解、生成与编辑的多模态模型。它采用双流架构,结合 MLLM 与 MM - DiT 能力,统一 10 个多模态任务,在多项基准超现有方法,代码已开源。

机器之心
产品应用8

AI 模特时代到来:字节x清华推出商用级视频换装模型DreamVVT,保真度显著领先SOTA

字节跳动智能创作团队联合清华推出视频换装模型DreamVVT,基于Diffusion Transformer构建,用两阶段设计解决复杂场景痛点,支持多种输入,在保真度和时序稳定性上领先SOTA。

机器之心
推荐文章7

对话 Roto:让视频实时可交互、足够个性化,我们要做 AI 时代的 Netflix

Roto定位是全球首个互动开放世界视频平台。创始人David Xu曾就职独角兽企业,涉足多模态生成。团队经多次方向调整,决定大胆探索极致创新。目前产品技术不成熟,但已探索新内容形式,还将在广告实现商业闭环。

Founder Park
推荐文章8

11Labs 增长负责人:搞营销要学着做视频,但创始人出镜会有点自恋

AI语音独角兽ElevenLabs增长迅猛,估值超30亿美元。其增长负责人Luke Harries分享独特策略,如分业务单元管理、重视视频营销、多渠道推广等,还给出团队搭建、产品发布等实用建议。

Founder Park
产品应用8

每帧Sora级震撼!Midjourney首个视频模型登场,超逼真大片首测来袭

Midjourney首个AI视频模型V1上线,每月10美金可体验20秒。其视觉效果惊艳,能媲美Sora等,还能一键让图像动起来。成本低,提供多种模式与设置,有技术愿景,未来将完善模块。

新智元
产品应用8

0成本升级,快手OneSearch-V2全量上线,生成式搜索进入「懂你」时代

快手技术团队在 OneSearch 基础上推出 OneSearch-V2 框架,解决电商搜索复杂查询理解不足等问题。该系统全量上线,不增成本与时延,业务收益显著,还缓解信息茧房与长尾稀疏问题。

机器之心
算法论文8

CVPR 2026|1分钟单图变4D视频!AI看图直接脑补物理规律

北京理工大学和理想汽车等团队提出全新框架PhysGM,引入DPO实现端到端快速前馈推理,能1分钟内将单图生成为4D动态视频,在速度和评价指标上超越主流模型,相关工作被CVPR 2026接收且代码已开源。

机器之心
推荐文章8

AI搜索优化(GEO):从“被看见”到“被选中”的7个真相!【必看】

白杨SEO分享AI搜索优化(GEO)从“被看见”到“被选中”的7个真相,含为何做GEO、竞争内容、让AI理解和信任品牌的方法、成默认推荐答案的条件、效果评估及长期坚持的原因等。

白杨SEO优化教程