「视频匿名化」共找到 1735 篇相关文章
41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码
智谱基于GLM - 4.5打造的开源多模态视觉推理模型GLM - 4.5V,在42个公开榜单中41项夺得SOTA。其功能丰富,玩法升级,还为企业与开发者提供高性价比方案,是100B参数级SOTA标杆。
新Vidu Q3参考生,这是冲着「剧」来的!万物皆可参考:特效音效场景都备好了
生数科技Vidu Q3发布参考生视频,为剧而生,万物可参。它能凭几张图和Prompt生成影视级特效、音效和场景。实测显示其特效、音效、场景表现出色,还解决AI视频创作痛点,兼顾专业与普惠。
CVPR 2026 | 从视觉Token内在变化量出发,实现VLM无损加速1.87倍
随着高分辨率图像与长视频处理需求增长,大型视觉语言模型推理效率成瓶颈。V²Drop从视觉Token内在变化量出发,采用多阶段渐进式剪枝策略,实现无损加速,在图像和视频理解场景表现卓越。
不只是行业 Know-How,营销类 Agent 工程化落地难题有何解?|对话瓴羊副总裁、友盟+总经理毛波
今年是“AI Agent 元年”,营销 Agent 热门但有难题待解。InfoQ 对话瓴羊副总裁毛波,探讨营销 Agent 落地困境、工程化挑战、未来护城河及发展机会,友盟+推出产品并提供方案助力解决问题。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
季度AI视频生成产品:多模态输入成标配,角逐一站式生成能力 | 量子位智库AI 100
Sora2下载量破百万引发AI视频生成热潮,谷歌推出Veo3.1再掀高潮。国外大厂将其卷至电影制作级创意,国内企业追求高质量、秒级生成并落地垂直场景。量子位智库发布的产品呈现多维度技术演进。
字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。
字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。
全球唯二、国内首个,阿里万相2.6杀疯!Sora 2瞬间不香了
阿里万相2.6系列模型上线,成为业界功能最丰富的视频模型,是全球唯二、国内首个具备角色扮演功能的模型。其音画一体,能生成15s长视频,指令遵循能力强。还可将提示词转换为多分镜脚本,团队公开了提示词公式。
刚刚,AI视频的天花板被掀翻!测完SkyReels后飘了:我亦有成为专业导演的潜质
昆仑万维官宣上线全新一站式多模态AI视频创作平台SkyReels,同步发布模型SkyReels V3并优化多能力。实测其画布、Agent等功能玩法多,还打通多模态边界,将巩固昆仑万维地位,加速人人专业创作愿景到来。
可从表复杂文档中提取结构化数据的Python库agentic-doc,支持100+页PDF长文档
LandingAI的Agentic文档提取API可从复杂文档提取结构化数据,Python库agentic-doc封装该API,支持100+页PDF长文档,有自动重试、并行处理等功能,还能可视化调试。