「互联网视频数据」共找到 3397 篇相关文章
数据集蒸馏,连发两篇顶会!10%样本实现全量性能,鲁棒不失真
数据集蒸馏能让模型高效节能,WMDD和GUARD两项研究分别解决保留原始数据特性、提升模型对抗扰动能力问题。WMDD用Wasserstein度量保留几何特性,GUARD平滑损失景观获对抗鲁棒性。
备受Meta折磨,LeCun依旧猛发论文!新作:JEPAs不只学特征,还能精准感知数据密度
备受Meta审核规定“折磨”,LeCun仍发新论文。其团队发现自监督模型JEPAs学会了数据“密度”,打破学界以往认知。还提出JEPA - SCORE工具,经多组实验验证其效果。
用AI把一段视频变成可视化网页,Google的新模型又卷飞了。
Google更新Gemini 2.5 Pro至05 - 06版。此版代码能力在WebDev Arena盲测登顶,超Claude 3.7 Sonnet;还提升视频理解,可将视频转为可视化网页,虽有产品打磨问题,但进步值得肯定。
5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!
今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。
Agentic Web:AI Agents如何重塑下一代互联网,一个到处是待研究与落地的方向
论文《Agentic Web: Weaving the Next Web with AI Agents》描绘颠覆性未来,AI 智能体成“数字代理人”,互联网将从“连接信息”向“执行行动”转变。论文给出构建下一代智能互联网路线图,剖析挑战、展示场景并预警风险。
阿里杀进Agent上下文战场:钉钉聊天、企业文档、工作数据终于要被Agent吃进去了
个人、企业用户苦工作场景「上下文」久矣,Agent常不懂真实业务。阿里千问办公开源的「MyContext」,将分散工作数据加工成Agent可消费的上下文,处理多种难题,还将能力向组织延伸,助力Agent融入工作流。
TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法
北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。
给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型
文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。
真碾压Sora了!谷歌Veo 3首次实现音画同步,视频模型直接「开口说话」
谷歌正式发布Veo 3,它能生成高质量视频,还能理解原始像素,自动生成与画面同步的对话、多种音效。得益于DeepMind的V2A底层技术,其音画合成功能领先。虽有时长和使用门槛限制,但已足够震撼。
当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?
在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。