「视频生成模型」共找到 8983 篇相关文章
4倍无损压缩Diffusion,6倍加速!仅需时间特征维护 | TPAMI'25
扩散模型时间特征对量化敏感,现有量化方法会致其扰动,影响图像质量。港科大等多校团队提出TFMQ - DM框架,优化时间特征相关模块,提升低比特量化性能,实现硬件加速。
The Batch: 981 | Ox Alpha 被揭晓为 GLM-5.3-Flash
本文是DeeplearningAI The Batch专栏的AI行业资讯,揭秘此前匿名上线爆火的Ox Alpha模型,公开其为Z.ai推出的GLM-5.3-Flash,详细介绍该模型的架构、性能、定价与授权信息。
AI 造谣,无人能幸免。
文章以现实中谣言传播现象为引,指出移动互联网加速谣言传播,而AI技术发展使真假更难分辨,如AI生成的图片、视频易以假乱真,还提到谷歌发布水印检测工具应对,呼吁大公司行动。
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
零样本刷新三项基准:ZeroDiff++让AI边考试边学习 | TPAMI'26
本文介绍发表于IEEE TPAMI 2026的ZeroDiff++模型,是ICLR 2025 ZeroDiff的扩展工作,针对生成式零样本学习的虚假语义关联、分布脱节问题提出新框架,在三项主流基准刷新成绩
告别AI「鬼画符」!一行指令「复活」王羲之、苏轼,带连笔、懂排版,项目已开源丨ICLR'26
UniCalli由香港科技大学(广州)等团队推出,是全新统一扩散框架,能精准生成书法排版和连笔,将书法生成和古籍识别统一,工作被ICLR2026接收,代码、数据集开源,还有在线Demo。
拆解爆火的 JEV(上):10 分钟看懂这款 Agent 的高速“协处理器”。
本文拆解硅谷近期爆火的JEV模型,讲解其作为Agent专属高速决策模型的定位、核心原理、实际调用案例,分析其优势与现存不足,帮助开发者快速了解这款新兴工具。
Qoder + ADB Supabase :5分钟GET超火AI手办生图APP
本文介绍如何用Qoder、阿里云ADB Supabase和通义千问图像编辑模型,快速搭建AI手办生图Flutter移动端应用,无需自建传统后端,涵盖思路、环境准备、各环节配置及流程等内容。
最新!Karpathy:Vibe Coding只是抬高了地板,真正的战场在这里
Andrej Karpathy在AI Ascent 2026上与红杉合伙人对话,分享自提出“vibe coding”一年来的变化。谈到技术转变、Software 3.0、模型“锯齿状”特征等,还区分了vibe coding和agentic engineering,指出人类需保留品味、判断力等。
「神经软件」正在到来,人类代码将失去意义!
Lambda Labs CEO Stephen Balaban 在英伟达 GTC 2025 提出神经软件概念,指不再写代码,让大语言模型成软件。它没传统软件的 bug 问题,未来计算机或端到端神经化,虽有争议,但变革在加速。