扩散视频模型」共找到 8154 篇相关文章

算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元
算法论文8

谢赛宁团队用RAE实现从8%到84%的飞跃,宣告VAE时代结束

谢赛宁团队用RAE新架构将ImageNet图像生成FID刷到1.13,宣告VAE组件过时。RAE结合先进表征学习成果与强大生成模型框架,解决诸多问题,还为其高维潜空间定制DiTDH架构,性能优异。

AIGC开放社区
开源动态8

小扎又开源了:7B实现自监督学习SOTA

Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。

量子位
开源动态8

抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o

抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。

量子位
算法论文8

ICML 2026 巡礼:注意力效率革命的九个切面

7月7日,ICML 2026进入正会第一天。雷峰网精选首日上午9篇论文,涵盖持续学习、多模态融合等方向,如MePo让预训练模型学会持续学习,HAF解决模态不平衡下的融合问题,展现AI研究前沿趋势。

AI科技评论
开源动态8

阿里刚刚开源了一款影视级配音项目,口型同步、音色转换都不是事!

阿里通义实验室语音团队联合中科大发布多模态电影配音模型Fun - CineForge,开源模型并构建中文电视剧配音数据集。它能处理多种场景,有视频理解等亮点,还给出制作数据集步骤。

开源星探
算法论文7

GPT-6要「活」了?MIT新作曝光,AI「自进化」不远了

麻省理工学院推出全新自适应大模型框架「SEAL」,让模型从「被动学习者」变为「主动进化者」。网友猜测GPT - 6可能整合其能力,成为能自主学习的模型,研究虽有局限,但为大模型自进化提供新路径。

新智元
产品应用7

AI+直播的新玩法! StreamDiffusionV2让创意零延迟

生成模型改变直播行业,但此前模型难保证时间一致性、有延迟等问题。加利福尼亚大学推出StreamDiffusionV2,通过智能调度和缓存机制优化,支持多GPU并行,可灵活调画质和延迟,实现实时直播。

带你学AI
产品应用8

阿里又放大招!一句话,造一个能走进去的世界

阿里上线HappyOyster 1.0世界模型,一句话生成可实时探索、交互的开放世界。它与文生视频不同,能让用户参与体验。该模型有世界探索和实时导演两大功能,技术优势显著,应用场景广泛。

新智元
算法论文8

RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑

北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。

机器之心