「图像到视频」共找到 3220 篇相关文章
海外华人15人团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑
海外AI初创公司Luma发布图像生成模型Uni-1,将「理解」与「生成」统一,在多任务测试中表现优于GPT Image 1.5和Google Nano Banana Pro。它采用独特架构,提升理解能力,由华人团队打造。
等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……
MiniMax新发布的视频模型H3在多模态能力出色,霸榜Artificial Analysis榜单。但开源模型有部署和成本难题,秘塔AI上线该模型,免部署,2K方案0.15元/秒,768P方案0.09元/秒,降低创作门槛。
文档秒变演讲视频还带配音!开源Agent商业报告/学术论文接近人类水平
澳大利亚和英国多所高校团队提出多模态智能体PresentAgent,能将文档转化为配有语音讲解和同步幻灯片的视频演示。其模块化生成框架有可控性和领域适应性,评估显示它在各指标上接近人类水平。
打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26
现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。
AI视频杀出一匹“快乐黑马”:把Seedance 2.0挤下榜首,幕后团队成谜
4月7日深夜,AI评测平台公告Video Arena新增匿名视频模型HappyHorse - 1.0,48小时后积分登顶,超过Seedance 2.0。网友猜测其出自中国团队,有线索指向Sand.ai等联合团队或阿里淘天集团。实测表现有亮点,Elo评分合理性存疑。
从「对口型」到「会表演」,刚进化的可灵AI数字人,技术公开了
快手可灵团队让数字人从「对口型」进化到「会表演」,全新数字人功能在可灵平台公测。技术报告Kling - Avatar解析背后技术路径,设计多模态两阶段生成框架,实验显示其在多方面领先竞品。
VLA爆发!从美国RT-2到中国FiS-VLA,机器人「即知即行」的终极进化
2025年具身智能爆火,VLA模型成核心。从美国RT - 2到中国FiS - VLA,VLA硬核进化。谷歌、微软等有重要成果,中国智平方等企业也不断创新,FiS - VLA性能超现有方法,VLA正重塑机器人与人类交互未来。
图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果
百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。
硬刚Sora2,万相2.6轻松定制角色、控制分镜,普通人也能当导演
2025 年视频生成领域发展迅猛,OpenAI 的 Sora 2 带来新玩法,商业落地加速,但普通用户体验门槛高。12 月 16 日阿里发布万相 2.6 系列模型,功能全面升级,实测效果惊人,标志 AI 视频生成迈向精准可控新阶段。
AAAI 2026|视频大语言模型到底可不可信?23款主流模型全面测评来了
合肥工业大学与清华大学团队推出视频大语言模型综合可信度评测基准 Trust-videoLLMs,对 23 款模型从五维度 30 项任务评测,揭示性能格局,指出模型现存问题,还开源评测框架等。