视频换装框架」共找到 2474 篇相关文章

开源动态8

多模态思维链如何重塑 AI 与短视频的未来

传统多模态模型在动态视频理解与复杂推理场景面临挑战,快手开源的 Keye-VL 模型在多模态思维链技术实现突破。文章解析其核心技术,分享在快手短视频社区的落地应用,还探讨了未来“Think with Video”的技术方向。

AI前线
产品应用8

这是我花9毛钱拍的《Meta老板砸钱把我从苹果挖走》

国产AI开启新Level,生数科技的Vidu Q1参考生视频功能,9毛钱+4张图就能生成视频。它重新定义叙事,砍分镜、拍摄等流程;有业内最强一致性;价格低,让AI视频生成“快、好、省”。

量子位
算法论文8

Agent框架各自为战?谷歌&微软:用Agent-KB让经验自由流动

当前不同框架的Agent知识无法互通,谷歌、耶鲁、字节、oppo等团队联合提出Agent KB,这是通用记忆基础设施,能让异构Agent框架共享经验。它有师生双阶段检索机制,实验验证其能带来显著增益。

PaperAgent
推荐文章7

快手高欢深度解读:多模态理解如何成为AIGC视频生成的“幕后功臣”?

2024 年 AIGC 爆发,多模态理解技术支撑 AIGC 原生应用。快手高欢在 AICon 大会分享多模态理解在 AIGC 场景应用,介绍主流 AIGC 产品形态,探讨其背后多模态理解方法、提升能力途径及赋能 AIGC 的方向。

InfoQ
算法论文8

具身智能能力狂飙,安全却严重滞后?首个安全可信EAI框架与路线图出炉!

具身人工智能发展迅速,但能力与安全出现“脱钩”。上海人工智能实验室和华东师范大学团队撰写论文,为“安全可信具身智能”建立理论框架与蓝图,提出成熟度模型、分析框架等。

机器之心
推荐文章8

当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?

在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。

海外独角兽
开源动态8

中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

近日,中国科学院等全球顶尖机构发布手术视频原生基础模型SurgMotion。它依托全球最大手术视频数据集,首次突破十亿级参数,覆盖17项核心手术任务,性能卓越,还在多领域形成生态共鸣。

机器之心
新闻资讯8

神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光

神秘具身团队放出一连串Demo视频,其内部代号“MVP”的模型让机器人似人般思考决策。视频展示机器人在不同场景下的表现,如躲避推搡、做家务、机器人协作、高效收纳等,体现对物理规则和人类习惯的理解与自进化能力。

量子位
新闻资讯8

从被100家VC拒绝到英伟达、字节抢着投,AI视频独角兽CEO揭秘“奇葩”用人哲学:不招精英

Synthesia是专注企业级AI视频方案的平台,愿景是让会用PPT的人轻松做视频。创业初被100位投资者拒绝,获Mark Cuban支持后走上正轨。产品受众多公司使用,ARR破1亿美元,还获英伟达、字节等投资,CEO用人不招精英。

AI前线
算法论文8

真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试

浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。

新智元