视频转图文」共找到 1120 篇相关文章

产品应用8

谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...

谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。

AI寒武纪
算法论文8

AAAI 2026 Oral | 悉尼科技大学联合港理工打破「一刀切」,联邦推荐如何实现「千人千面」的图文融合?

悉尼科技大学龙国栋团队联合港理工杨强、张成奇团队提出 FedVLR 框架,解决联邦环境多模态融合异质性难题,被 AAAI 2026 接收。该框架创新性强,可提升推荐指标,代码已开源。

机器之心
开源动态8

「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了

近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。

量子位
开源动态8

5.8K Star爆火!!在终端里开网页、刷视频、玩游戏,这操作真绝了!

介绍开源工具`term.everything`,它能在终端运行任何GUI应用,像浏览器、游戏等。该项目在GitHub获5.8K star,支持X11和Wayland应用,可远程使用,但画质和性能有局限。

开源先锋
开源动态8

Github 3.6k star,爆火开源「小红书 MCP」:一键登录、图文发布、搜索、评论全搞定

`xiaohongshu-mcp`把浏览器手工步骤封装成可编排工具,以Go编写,能在无头/有界面模式间切换。它解决小红书运营多痛点,如登录不稳、发帖链路长等,覆盖登录、发帖等全链路,适配多客户端,值得收藏上手。

小华同学ai
开源动态8

首个Data Agent基准测试来了!2007个测试任务将数据库、PDF、视频、音频异构数据源一网打尽

南洋理工大学、新加坡国立大学与华为开源首个针对数据智能体异构混合数据分析的基准测试FDABench。它有2007个任务,覆盖多领域多数据源,独创协作框架,能测多种工作流模式的数据智能体。

量子位
产品应用7

刚刚,全网最猛AI视频模型免费了!我们手搓了一段「牛来」,效果绝了

AI短剧火爆,但创作者面临成本高痛点。Agnes Video 2.5系列模型上线Pavo平台,成本低效果好,其Flash版免费。Pavo还有「无限画布」和「Agent创作模式」,降低返工成本,实现低门槛创作。

新智元
产品应用8

生数科技认领神秘登顶模型:AI视频公司拿出工业级Demo,跨本体跑通复杂长程任务

生数科技认领神秘登顶模型MotuBrain,该模型4月中旬悄登两国际benchmark。它将预测与行动统一,具一脑多型等能力,技术上走边看边动路线,有响应快等优势。生数科技双轨布局,Vidu与MotuBrain同根。

量子位
新闻资讯7

每周产业洞察 | AI音视频赛道现“隐形冠军”小众需求催生健康商业模式,工程能力成盈利分水岭

北京AIGC视听产业创新中心位于朝阳区,是朝阳区推动影视制作基地建设举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚60余家合作伙伴。首创郎园拓展服务边界,项目延伸多地。

郎园Station
算法论文8

用2D数据解锁3D世界:首个面向运动学部件分解的多视角视频扩散框架

张昊等提出 Stable Part Diffusion 4D (SP4D) 框架,由 Stability AI 与 UIUC 联合完成。它能从单目视频生成多视角 RGB 与运动学部件序列,解决运动学部件分解及自动 rigging 问题,实验效果显著,被 Neurips 2025 接受为 Spotlight。

机器之心