VLM多模态理解能力」共找到 1578 篇相关文章

新闻资讯7

欧洲黑马Mistral Medium 3来了!跑分对标最强Claude,实测大翻车

Mistral AI发布多模态模型Mistral Medium 3,官方称其性能接近Claude Sonnet 3.7且成本低,有诸多亮点。但网友实测结果不一,部分大佬认为性能不如官方宣传,建议别下载。

新智元
新闻资讯7

聚焦物理智能最前沿,PAIR首届年度会议即将开启!

当大模型能理解语言与图像,‘物理智能’指向智能从比特到原子的跨越。2026 年 9 月 20 - 21 日,上海物理智能与机器人研究院将主办‘PAIR Conference 2026’,设主题学术和商业闭门会议。

DeepTech深科技
算法论文8

AI终于“长”进机器人身体里!机械臂学会用触觉思考

香港科技大学申亚京教授团队研发出具身机器人手臂 EmArm,实现亚毫米级触觉定位与实时‘感知 - 行动’闭环。研究还提出‘感知 - 驱动’一体化算法,为打造物理 AI 机器人提供可扩展技术路径。

DeepTech深科技
开源动态8

斩获近5w star!这个开源AI工具让你30 秒搞定“过去30天真相”!

信息碎片化时代,last30days开源AI工具聚合各平台“人群智慧”,按真实人群参与度打分合成摘要。它能搜索多平台,v3版有智能搜索等新功能,输出HTML摘要,优点多且易上手。

GitHubStore
产品应用8

阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天

阿里发布原生流媒体端到端模型Wan - Streamer v0.1,能实时聆听、观看、思考、说话和响应视频。它在单个Transformer内完成感知等操作,延迟低,具备端到端多模态统一、低延迟等特点。

开源AI项目落地
产品应用7

豆包推出专业版,能成为你的「工作搭子」吗?

6月24日,豆包发布基于最新豆包2.1系列大模型的专业版,新增Agent驱动办公任务模式,支持理解目标、拆解任务等。它回应了用户需求分化,还改变评价标准,有望成生产力入口。

AI科技评论
开源动态8

从3632个漏洞看AI时代的评测基准重构!VulnGym基准发布

随着新一代漏洞检测工具出现,漏洞检测走向理解业务风险。腾讯悟空安全团队联合多机构发布 VulnGym 评测基准,基于真实漏洞构建,覆盖 400+ 漏洞路径,71.2% 为业务逻辑漏洞,支持确定性评测。

腾讯技术工程
算法论文8

ACL 2026|证据摊开看,场景图画清:让流式视频大模型拿捏「何时开口」

随着多模态和大语言模型发展,人类与 AI 交互走向共生。现有视频大模型难把握响应时机,西北工业大学等团队在 ACL 2026 提出 Response - G1 框架,实验显示其提升了模型性能。

机器之心
产品应用8

X-Era蝉联双榜单冠军,引领世界模型未来方向

X-Era的EonWorld在WorldScore和WorldArena两个榜单上连续霸榜。它来自X-Era的VWA原生世界动作模型体系,本职是帮机器人预判世界变化。这为“可用于行动的世界模型”竖起能力线,也揭示行业正进入新阶段。

AI科技评论
算法论文8

从「说错话」到「干错事」:复旦、CityUHK、SMU、UIUC等13家机构联合发布「具身智能安全」综述

具身智能正从实验室走向现实世界,却带来‘干错事’的现实风险。13家机构38位学者联合发布70+页综述,提出‘能力—风险’二象性,梳理各能力层攻击面与风险,还指出研究空白,维护开放资源生态。

机器之心