多模态理解」共找到 1546 篇相关文章

开源动态8

准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用

近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。

量子位
开源动态8

字节开源终身记忆多模态智能体,长时记忆+RL,实测超Gemini‑GPT4o!

字节开源全球首个带终身记忆更新的全多模态智能体M3 - Agent,给其装上‘长期记忆’大脑。它构建实体记忆图谱解决现有Agent问题,架构含两个流程,代码实现有特色,跑分数据出色。

探索AGI
算法论文8

230个大模型在婴幼儿认知题上集体翻车!揭秘多模态大模型的核心知识缺陷

ICML 2025研究揭示多模态大模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。

量子位
开源动态8

小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度

小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。

量子位
推荐文章8

Agent 一年半开发复盘:大家对 Agent 的理解有错位,有效的「认知流程」很关键

本文是作者对一年半AI开发过程的复盘,指出大家对Agent理解有错位,强调有效「认知流程」的关键作用。通过高考、学霸成长等例子阐述Agent核心,对比Chatbot与Agent,还从理论视角解释其有效性,最后点明开发者角色转变及面临的挑战与前沿探索方向。

Founder Park
开源动态8

首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,ScienceBoard来了

ScienceBoard是首个面向科学任务、真实交互、自动评估的多模态智能体评测环境。它集成多领域科研软件,构建科研任务集合,评估智能体在科学任务上的表现,发现现有模型在科研工作流中远未成熟。

机器之心
开源动态8

不堆参数堆架构,这个8B开源模型把图像理解和生成统一了

商汤开源全新架构的理解生成统一模型SenseNova-U1,虽小尺寸版仅8B参数,却能复刻GPT - Image - 2的不少绝活,在多项指标上登顶开源模型榜首,推理速度逼近主流商用闭源模型。它具备连续性图文创作等能力,底层是NEO - unify架构。

量子位
算法论文8

腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态大模型

多模态大语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。

深度学习自然语言处理
开源动态8

一张4090就能爆改!面壁智能MiniCPM-V 4.6开源,1B多模态卷出新高度

今年是AI应用大规模落地年,参数小的端侧模型有特定场景性能优势。5月11日面壁智能开源MiniCPM-V 4.6,参数仅约1B,多模态能力超阿里、谷歌同类模型,还在多维度提升,站稳端侧多模态开源领域。

机器之心
算法论文8

Attention真的可靠吗?上海大学联合南开大学揭示多模态模型中一个被忽视的重要偏置问题

上海大学曾丹团队联合南开揭示Vision - Language Models中普遍的attention偏置问题,提出无需重训的去偏方法,在多模型、策略及基准上验证有效性,为多模态模型部署提供新思路。

机器之心