视频质量」共找到 1526 篇相关文章

算法论文8

ICLR 2026 | 当视频难以被表征:UCSD、HKUST等机构联合提出FlowRVS,用生成式流匹配重构视觉感知范式

计算机视觉领域传统表征方法在视频处理上力不从心,SGIT AI Lab等机构团队提出FlowRVS,跳出传统桎梏,用生成式流匹配重构视觉感知范式,实现SOTA提升,还展现诸多优势,证明Flow Matching理论普适性。

机器之心
开源动态8

不用千亿参数也能合成高质量数据!这个开源框架让小模型“组团逆袭”,7B性能直追72B

上海人工智能实验室与中国人民大学提出GRA框架,以“多人协作”理念让小模型分工生成高质量训练数据。实验显示其生成数据质量高,项目已开源。它打破对大模型蒸馏依赖,展现“集体智能”潜力。

量子位
产品应用7

豆包大模型2.0+Claude Skills,3步装好,终于有AI能帮我"看视频做笔记"了!火山引擎全系列可用!

传统视频总结工具只基于音频总结,内容浅显。而豆包大模型2.0是多模态原生模型,能同时处理画面和声音。只需3步安装配置,就能让它真正“看”视频,输出详细笔记。

AI产品自由
新闻资讯7

谷歌也要「AI抖音」了!新Veo 3.1原生支持竖屏,4K分辨率高画质

谷歌Veo 3.1升级,全方位提升视频生成质量,新增竖屏和4K两大特性。它还提升创意、一致性和元素融合能力。谷歌借此进军AI短视频,结合自身优势推动“AI视频竖屏化”趋势。

量子位
算法论文8

给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型

文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。

机器学习AI算法工程
算法论文8

OmniInsert:全新无掩码视频插入技术

基于扩散模型的视频插入技术发展快,但以往方法有局限。字节提出InsertPipe和OmniInsert,解决数据不足等难题。OmniInsert设计巧妙,还建立评测平台InsertBench,虽有小问题,但推理快,可加速优化。

带你学AI
算法论文8

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。

机器之心
产品应用7

字节推出全新视频换装框架DreamVVT

视频虚拟试穿技术受关注,但现有方法有局限。字节推出DreamVVT框架,基于扩散变换器,分两阶段试穿,能应对多种复杂场景,不过也存在依赖遮罩、复杂动作表现不稳定等问题。

带你学AI
开源动态8

打破数据质量鸿沟!清华腾讯Bee项目发布1500万高质量数据集,刷新MLLM全栈开源SOTA

全开源多模态大模型性能被闭源和半开源模型“卡脖子”,根源在于数据质量。清华与腾讯混元团队推出Bee项目,有三大核心贡献,产出的Bee - 8B模型表现领先,证明保证数据质量比堆量更有效。

量子位
开源动态8

视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理

快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。

量子位