「图像转视频」共找到 1433 篇相关文章
最新研究揭示视觉模型与人脑的对齐机制
FAIR与巴黎高等师范学院通过训练自监督视觉Transformer模型(DINOv3),评估脑 - 模型相似性。发现模型大小、训练数据量和图像类型影响相似度,DINOv3学到的表征会逐步与人脑一致。
ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成
本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。
准确率腰斩!大模型视觉能力一出日常生活就「失灵」
EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。
全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来
这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。
大道至简,何恺明团队新作pMF开启像素级「无潜、单步」生成范式
何恺明团队新论文提出用于单步、无潜空间图像生成的pMF框架,直指主流扩散与流匹配模型通病。该框架将v、u和x三个场关联,训练网络把噪声输入直接映射为图像像素,实验表现强劲。
AI问答,直接「拍」给你看!来自快手可灵&香港城市大学
来自快手可灵团队和香港城市大学的研究者提出「视频作为答案」任务范式,发布VANS模型。它由视觉语言和视频扩散模型构成,通过联合分组相对策略优化算法协同优化,在教学和预测应用上效果超现有模型。
AI遭遇灵魂拷问!这道题所有模型集体翻车,网友:我也不会啊
图像推理现新难题,在Reddit引发热议,目前无AI能真正解决。国内外支持图像输入的大模型答案不同,原因是对大立方体规格理解不同。结合提示多次尝试,部分大模型能找准方向,人类面对该问题也会困惑。
马斯克还在卷10秒,中国AI直接掀桌!16秒一镜到底,全球唯二
2026年AI视频圈竞争激烈,硅谷巨头激战正酣,马斯克Grok Imagine上线生成10s视频功能。在此背景下,中国AI的Vidu Q3登场,16s音画直出一镜到底,还支持多种功能,位列中国第一、全球第二。
给 Happy Horse-1.0 讲完戏,我无痛当上导演了
文章聚焦阿里新发布的视频模型Happy Horse-1.0,经测试它在多镜头一致性、人物表现力和视频编辑功能上表现出色,能产出电影质感画面,且价格有竞争力,但物理拟真短板明显,已具影视工业应用潜力。
给 AI 一张陶罐碎片图,它能还原破裂过程吗?Minimax H3 vs Seedance 2.0 Fast 实测
文章实测 MiniMax H3 和 Seedance 2.0 Fast,给模型一张破碎陶罐图,让其生成破碎过程视频。分析 H3 技术逻辑,对比两模型效率、质感和物理细节等差异,指出开放与闭源模型的特点及视频模型待解决的问题。