「流式数据集」共找到 2638 篇相关文章
ICCV 2025 | 跨越视觉与语言边界,打开人机交互感知的新篇章:北大团队提出INP-CC模型重塑开放词汇HOI检测
北大团队提出 INP - CC 模型重塑开放词汇 HOI 检测。它提出交互感知提示生成和概念校准两项创新,结合输入图片特性构造提示集合,引入‘困难负样本采样’策略,在两大数据集上表现超 SOTA。
李飞飞押注的「世界模型」,中国自研Matrix-3D已抢先实现了?
中国自研世界模型Matrix-3D可单张图生成3D世界,效果对标李飞飞的World Labs,还能实现更大范围探索。它有诸多优势,技术上有创新,数据集有特点,应用前景广泛。
GPT-4V仅达Level-2?全球首个多模态通才段位排行榜发布,General-Level打造多模态通用AI评测新范式
General-Level团队提出全新评测框架General-Level和数据集General-Bench,构建超大规模评测基准和多模态通才模型排行榜。其用五级段位体系衡量模型通才能力,General-Bench覆盖多模态任务,排行榜分多层次榜单,目前各模型段位差异大,Level-5空缺。
Monet:赋予多模态大模型如人类一般的抽象视觉思考能力
文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。
谷歌痛失王座?港科大贾佳亚团队DreamOmni2开源,超强P图暴击Nano Banana
港科大贾佳亚团队开源DreamOmni2,该模型基于FLUX Kontext,能处理多参考图像,在多模态编辑与生成上表现出色,超越谷歌Nano Banana等模型,还构建了新测试集与数据构建范式。
必须得让AI明白,有些不该碰的东西别碰(doge)
近期类o3模型在视觉推理任务表现优异,但陷入‘盲目用工具’状态。港中文MMLab等团队提出AdaTooler-V模型,具备自适应工具使用能力,还引入指标、算法,构建数据集,在多基准测评中优势明显。
他们在1993年就提出了Scaling Law
原来,Scaling Law在32年前就被提出了,不是2020年的OpenAI、不是2017年的百度,而是1993年的贝尔实验室。在一篇文章里提出一种预测方法,研究人员可以预测模型在更大数据集上的表现,这和现在大家常提的Scaling Law几乎一致。
让AI打游戏!能玩1000多款游戏,英伟达用4万小时视频训练出通用基础模型NitroGen
NVIDIA发布NitroGen模型,利用40000小时带按键显示的游戏视频,构建视觉-动作数据集,训练出能玩超1000款游戏的通用基础模型,在跨游戏泛化和微调任务中表现卓越,为具身智能发展提供新思路。
英伟达发布并开源Alpamayo:自动驾驶终于开始讲道理了|甲子光年
北京时间今天凌晨,英伟达在CES现场发布Alpamayo系列开源AI模型、仿真工具及数据集,旨在推动推理型自动驾驶汽车开发。其核心模型Alpamayo 1可展示决策逻辑,此次发布是英伟达在该领域开放程度最高的尝试。
大模型桌游试玩员来了:用五大画像模拟「千人千面」,评分精准度超越GPT-5.1
盛大东京研究院等团队提出MeepleLM,首个能模拟玩家视角给出建设性批评的虚拟试玩模型。它构建专属数据集,引入MDA理论,提炼五种玩家画像。实验显示其评分精准度超GPT - 5.1等通用模型。