长视频数据」共找到 3749 篇相关文章

产品应用8

大神Karpathy都投的AI实时视频生成模型:直播都能立即转,无限时几乎零延迟

AI初创公司Decart推出首个零延迟无限实时视频生成的AI模型MirageLSD,大神Karpathy都投资了。它能实时生成视频流,无时限制且延迟低至40毫秒以下,还攻克了传统模型‘误差累积’难题。

量子位
开源动态8

开源 AI 视频平台

开源 AI 视频平台集成剪辑生成器、AI 短视频、YouTube 工作室三大工具,能将视频转短视频,为业务生成营销视频,还具备免费 YouTube 工具包。支持多平台发布,自托管永久免费。

GitHubStore
开源动态8

浙大联手字节:开源大规模指令跟随视频编辑数据集OpenVE-3M

浙江大学与字节跳动合作,提出大规模指令跟随视频编辑数据集 OpenVE-3M,有 3M 样本对。还提出数据构造管线、编辑模型 OpenVE-Edit 及评测集 OpenVE-Bench,小参数量下超越现有开源模型。

机器之心
算法论文8

大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026

阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。

量子位
开源动态8

美团视频生成模型来了!一出手就是开源SOTA

美团开源视频生成模型LongCat - Video,参数13.6B,支持文生/图生视频,时可达数分钟,生成视频真实自然,文生视频能力顶尖,整体质量优,采用MIT协议。还介绍了其功能、技术原理及美团此前的AI成果。

量子位
8

无限、零掉帧!StableAvatar口型同步全新技术

当前音频驱动头像视频生成扩散模型合成视频时难兼顾音频同步与身份一致,瓶颈在音频建模。复旦大学提出StableAvatar,首个端到端视频扩散Transformer,能无限时生成,还介绍原理与演示效果。

带你学AI
算法论文8

TACL 综述 | 别只卷架构了——文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视上下文语言模型,指出上下文能力本质是数据驱动。它建立分类体系,明确高质量数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
新闻资讯8

数据限制具身?觅蜂杀进场破局:高质量数据水电一样即取即用

2026年4月16日,觅蜂科技发布一站式物理AI数据服务平台等,董事姚卯青称当前具身智能面临数据荒漠问题。觅蜂打造“又全又好又快”数据供给,还启动蜂巢数据共创行动,与多家企业合作。

机器之心
算法论文8

ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据

来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。

机器之心
算法论文8

ICLR 2026 | CineTrans: 首个转场可控的多镜头视频生成模型,打破闭源技术壁垒

随着视频生成模型发展,影视级视频需多镜头序列及自然转场,这成新挑战。上海人工智能实验室团队提出 CineTrans 模型,基于掩码机制实现自动化转场,还构建 Cine250K 数据集,实验效果超基线。

机器之心