具身视觉」共找到 1606 篇相关文章

开源动态8

8B硬刚72B!MiniCPM-V 4.5技术报告正式出炉

行业首个备“高刷”视频理解能力的多模态模型MiniCPM-V 4.5技术报告发布,提出三项关键技术,使模型在多任务达同级SOTA,8B参数规模超72B模型,推理快,开源后获社区好评。

量子位
产品应用7

对话「闪念贝壳」创始人 Ping:用 AI 抓住灵感消散前的 3 秒

本文是对闪念贝壳创始人 Ping 的访谈。他讲述创业初心,介绍闪念贝壳这款语音记录笔记产品,称其与传统笔记不同,更注重驱动思考和行动,还分享用户案例、谈竞品及硬件计划等。

特工宇宙
算法论文8

ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力

科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。

机器之心
算法论文8

X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA

中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。

机器之心
产品应用7

Omni-Effects:首个统一多特效生成框架

Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。

带你学AI
算法论文8

LeCun出手,造出视频世界模型,挑战英伟达COSMOS

训练有效世界模型面临数据、任务难度、算力消耗和评估等难题。Meta研究者提出通用视频世界模型DINO - world,可预测未来帧,在多方面有优势,实验显示其性能显著,能降低对标注数据需求。

机器之心
8

打脸OpenAI!谷歌Gemini高级版获IMO 2025官方认证金牌:纯自然语言端到端推理

谷歌DeepMind宣布高级版Gemini在2025年IMO中6题解5题获金牌,经官方认证,全程用自然语言推理。对比OpenAI自我宣称拿金牌,谷歌成绩更有说服力,还介绍了Gemini进步及实现方法。

AI寒武纪
算法论文7

ICLR 2025新成果:文档检索“降本增效”,从此“开挂”

传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。

CourseAI
算法论文8

ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI

上海人工智能实验室与新加坡南洋理工大学合作研发 Evaluation Agent,它能按需评估视觉生成模型,有可定制、高效率等优势。框架分提案和执行两阶段,评估结果佳,未来将拓展功能。

机器之心
开源动态8

750城市+5000小时第一人称视频,上海AI Lab开源面向世界探索高质量视频数据集

上海人工智能实验室等机构联合推出持续迭代的高质量视频数据集项目Sekai,含Sekai-Real和Sekai-Game两个数据集,还训练了模型Yume。它特点突出,团队按四环节构建,望成世界建模等领域的数据基石。

量子位