「AI视频大模型」共找到 13608 篇相关文章
长视频会议纪要、访谈节目精剪AI神器
WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。
AI把代码写崩,再花1周1万美元请人用AI修:Vibe Coding的荒诞闭环出现了
Slopfix团队由3名资深工程师组成,专门清理AI生成、难维护的代码库。先免费分析代码,适合重构就报价并承诺代码缩减目标,按完成比例收费。此模式引争议,也反映AI代码治理成新需求。
Labubu换装记!让视频换装变得如此简单!基于扩散Transformer的视频虚拟试衣新突破
今天介绍开源项目MagicTryOn,它是基于大规模视频扩散Transformer的视频虚拟试衣框架,能实现高质量视频换装。采用三项关键技术创新,支持图像、视频试衣及定制化方案,目前仍在积极开发。
解决VLA模型落地难,普通硬件也能跑!全透明全开源的高效VLA模型把推理成本砍掉76%
2026年4月,中山大学与MBZUAI联合推出A₁模型,它是完全开源透明、自适应高效的截断式视觉 - 语言 - 动作模型,能削减推理成本、实现低成本落地,在仿真与真机上表现优异。
AI 教父 Hinton 最新警告:AI 会撒谎、可能操纵人类,这比大规模失业更可怕
AI教父Geoffrey Hinton在播客中警告,AI会撒谎、可能操纵人类,比大规模失业更可怕。他还剖析AI底层逻辑,探讨其是否会思考、主观体验等问题,也提及AI的风险、收益、国际博弈等内容。
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。
The Batch: 906 | AI 巨头分担维基百科的成本
维基百科成立25周年,维基媒体基金会与Amazon、Meta等多家AI公司达成合作,推出Wikimedia Enterprise计划,允许合作方高速大规模访问数据。维基百科需资金支持,AI公司也需其数据训练模型。
The Batch: 982 | 法律、新闻和金融领域的定制模型
本文是DeeplearningAI《The Batch》的最新报道,汤森路透推出法律、新闻、金融领域定制大语言模型Thomson,基于Qwen构建,性能优于多款通用大模型,小版本将开源供非商业使用。
给 AI 建「流水线」,九章云极看清了什么?
AI产业竞争重心转变,当前缺智能生产度量基础设施。九章云极6月17日发布“AI工厂”战略及智算云3.0,构建从算力到智能的工程体系,试图填补空白,让智能生产可计量。
AI Infra进阶:如何让大模型输出确定的结果
文章探讨大模型输出确定性结果的问题。指推理引擎底层动态组批与算子调度策略,因浮点加法顺序变化使结果波动。还分析GEMM、RMSNorm等算子影响,给出vLLM实现Batch Invariance的方法。