多模态视觉作品」共找到 1464 篇相关文章

新闻资讯8

内容娱乐新风向:这群创业者靠多模态 AI 玩出了新花样

12月23日,「MASHANG DEMO TO DAILY」第二期活动在杭州开启,展示多模态AI探索成果。6位创业者分享精华内容,涉及游戏开发、虚拟社区、视频创作等领域,探讨多模态AI产品价值与发展方向。

特工宇宙
开源动态8

Qwen3-VL-Embedding系列上新:探索统一多模态表征与排序

2025年6月曾开源Qwen3-Embedding和Qwen3-ReRanker,现推出Qwen3-VL-Embedding和Qwen3-VL-Reranker。它们基于Qwen3-VL构建,能处理多模态输入,在多任务达业界领先,还介绍了特性、评测及使用方法。

通义千问Qwen
8

仅2G内存可跑,刚刚,谷歌开源Gemma 3n,端侧原生多模态

谷歌全面发布Gemma 3n,将多模态AI功能带入边缘设备并在Hugging Face开源。它原生支持多模态输入输出,针对设备端优化,内存占用低,采用开创性架构,Gemma系列质量也不断突破。

PaperAgent
开源动态8

开源即屠榜!UniME多模态框架登顶MMEB全球训练榜,刷新多项SOTA纪录

格灵深瞳等团队联合发布通用多模态嵌入新框架UniME,刷新MMEB训练榜纪录。它是两阶段框架,经文本判别知识蒸馏和困难负样本增强指令微调,在多任务达SOTA,项目已开源。

量子位
开源动态8

18K+标星!视觉AI驱动的浏览器自动化,告别XPath,无惧网页改版!

网页自动化常遇页面更新脚本报废等难题,而开源工具Skyvern不走传统XPath/DOM路子,用视觉+大语言模型理解网页,能自适应改版,功能丰富,安装运行简单。

开源星探
算法论文8

最新视觉大模型 DINOv3论文精读(逐段解析)

DINOv3是突破性自监督视觉基础模型,其创新围绕数据与模型协同扩展、Gram锚定技术、多阶段训练策略。它解决传统自监督学习难题,在多任务上无需微调达最优,为计算机视觉树立新标杆。

机器学习AI算法工程
算法论文7

OpenClaw的风刮到了多模态生成,6B小模型超越Nano Banana 2!

现在多模态生成模型在复杂指令和下游任务表现不佳。上海人工智能实验室等团队提出GEMS,将OpenClaw成功应用于多模态生成领域,激发小模型潜力,让6B小模型部分任务超越Nano Banana 2。

量子位
产品应用7

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

随着AI生图能力提升,如何让AI进入创作流程成新问题。兔展智能基于UniWorld - Design视觉AI大模型推出RabbitVis,推动视觉AI从图片生成走向可编辑、可交付的创作流程,解决创作流程断点问题。

机器之心
开源动态8

视觉强≠能干活!清北普林斯顿等开源WorldArena,世界模型评测被颠覆

2026 年 2 月 13 日,清华、北大等顶尖机构联合推出的 WorldArena 面向全球开源。这是首个‘功能 + 视觉’统一评测体系,撕开了‘美丽视频’伪装,让评测从‘审美导向’走向‘功能导向’。

机器之心
算法论文8

中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考

上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。

机器之心