「图像转视频」共找到 1433 篇相关文章
将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式
快手发布新版多模态大模型Keye-VL-2.0-30B-A3B,率先将DSA机制引入多模态理解场景,解锁256K超长上下文深度感知,还首次解锁Agent协作机制。该模型在多方面表现出色,且将融入业务带来收益。
打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑
当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退化,提升视觉质量与跨视角一致性。
17K+ star!ElevenLabs 超强平替,能克隆、能混音、能 API 调用!
ElevenLabs 效果好但价格贵且有隐私风险,现开源项目 Voicebox 是其免费替代。它本地优先运行,功能丰富,如语音克隆、文本转语音等,在 GitHub 收获 17.4K+ Star,适合多类用户。
阿里开启 Token 战略,喊出云+AI 年收入破千亿口号,底气从哪来?
3月19日晚,阿里在财报电话会提出未来五年云与AI商业化年收入破1000亿美元目标。过去三月,阿里云Token消耗涨6倍,自研芯片交付47万片,还提价。其正从‘用户红利’转向‘Token经济’,有望‘量价齐升’。
轻量又好用的 RAW 图片编辑器
RapidRAW 是轻量的 RAW 图像编辑器,适用于多系统,为偏爱简洁流程的摄影师打造。它有 GPU 加速等特性,提供三种 AI 使用方式,有免费与付费选项,还介绍使用方法和系统要求。
让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」
在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。
向黄仁勋汇报的英伟达36人
文章曝光向英伟达CEO黄仁勋汇报的有36人,分属七个职能板块。硬件是基石,AI等成“第二支柱”,还需系统化对外沟通机制,文中介绍关键将领,也谈及管理模式变化及高压文化。
NeurIPS 2025 | 北大联合小红书提出Uni-Instruct:ImageNet单步生图FID进入1.0时代!
北大联合小红书提出的 Uni - Instruct 框架被 NeurIPS 2025 接收,它统一超 10 种单步扩散模型蒸馏方法,在多项任务达最佳性能,还能用于文本到 3D 生成。
3B Image Captioning小钢炮重磅来袭,性能比肩Qwen2.5-VL-72B
文章推荐Dense Image Captioning新技术CapRL,它首次将DeepSeek - R1强化学习法用于image captioning,创新定义reward。训练的CapRL - 3B模型性能比肩Qwen2.5 - VL - 72B,解决了reward设计难题,已开源相关内容。
n8n官方推出AI工作流生成器,用自然语言构建工作流
n8n官方推出AI Workflow Builder,可将文字提示转成可执行工作流,本周向n8n Cloud用户推送。该功能降低构建门槛,但易用性提升也带来新挑战,其是否沦为‘面向VC’功能待验证。