视频推理数据集」共找到 4900 篇相关文章

开源动态8

美团视频生成模型来了!一出手就是开源SOTA

美团开源视频生成模型LongCat - Video,参数13.6B,支持文生/图生视频,时长可达数分钟,生成视频真实自然,文生视频能力顶尖,整体质量优,采用MIT协议。还介绍了其功能、技术原理及美团此前的AI成果。

量子位
算法论文7

生成式推理再排序,可能会是LLM4RecSys的新突破口吗?

Meta AI研究者尝试把推理模型引入推荐系统再排序阶段。论文通过监督微调等赋予模型推理能力,超LLM4Recsys标杆。中期内化物品语意ID,生成推理路径,推理赋能再排序,披露重排序提升空间。

机器之心
开源动态8

哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型

动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。

带你学AI
开源动态8

全球首个!10万小时人类数据全开源,Hugging Face罕见站台

上周Dyna Robotics公司用超100万小时人类第一视角视频训练DYNA - 2模型,发现物理AI有Scaling Law。8月20日光轮智能宣布10万小时全模态人类行为数据EgoSuite - Open100K开源,与Hugging Face联合发布。

新智元
新闻资讯8

全球首个真实世界具身多模态数据集,它石智航交卷,比特斯拉还早6个月

它石智航发布全球首个大规模真实世界具身VLTA多模态数据集WIYH,将于2025年12月开放。该数据集突破大,特点鲜明,优势明显,其发布填补数据空白,奠定以人为本范式。

量子位
算法论文8

西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026

AI 视频生成目前存在长视频稳定性问题,西湖大学张驰团队提出 《Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction》。研究表明 FreeLOC 方法能提升长视频生成质量,且具跨模型通用性,还揭示了问题机制,降低算力成本。

AI科技评论
新闻资讯7

特斯拉OpenAI数据路线遇挫!8千平具身「兵工厂」+ego众包狂飙

2024年特斯拉和OpenAI在机器人数据采集上路线不同,前者重资产高精度,后者低成本众包。当前数据采集方式各有优劣,难以兼顾质量与成本。数据堂提出分层采集架构,通过场内工厂化和场外众包化双轮驱动解决难题。

新智元
算法论文8

ICCV2025 | One image is all you need,多模态指令数据合成,你只管给图,剩下的交给Oasis

近年来多模态指令数据合成依赖人工设计提示词,成本高。本文提出 Oasis 方法,仅靠图像生成数据,打破传统输入模式,还开源代码库 MM - INF。实验显示其数据多样,能提升 MLLM 性能。

机器之心
新闻资讯7

告别传统存算分离,AI时代数据底座迎来全新底层逻辑

文章围绕AI时代数据底座变革展开。指出传统大数据平台难适配AI,存在数据够不着、模型用不好等问题。阐述AI时代基础设施变化,如数据形态、计算模式等。还探讨底座升级条件、存储挑战、算子价值及未来标准层等内容。

AI前线
算法论文8

SFT在帮倒忙?新研究:直接进行强化学习,模型多模态推理上限更高

学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但新研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型多模态推理上限更高,该团队训练的模型还刷新了纪录。

机器之心