视觉语义场景补全」共找到 2592 篇相关文章

算法论文8

大模型时代,通用视觉模型将何去何从?

过去通用视觉模型(VGM)是研究热点,想实现‘视觉模型大一统’。但大语言模型发展使研究热点转移,视觉‘独立性’被重新定义。清华鲁继文团队综述梳理其进展,探讨现状、挑战与应用潜力。

机器之心
算法论文8

视觉感知RAG × 多模态推理 × 强化学习 = VRAG-RL

数字化时代视觉信息愈发重要,传统RAG方法处理视觉信息面临挑战。阿里巴巴通义实验室的VRAG - RL将强化学习引入多模态智能体训练,革新检索生成范式,提升视觉语言模型多方面能力,代码已开源。

PaperAgent
产品应用7

阿里千问你别太荒谬!连漫画PPT都能一键生成?我以前那些夜真是白熬了

阿里千问发布AI PPT生成工具Qwen AI Slides,从内容结构到视觉配图全包。实测显示,其语义理解能力不错,文本渲染在简单字体表现好,排版有小瑕疵,适合课堂展示等场景

量子位
开源动态8

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元
算法论文8

AAAI 2026 Oral | 告别注意力与热传导!北大清华提出WaveFormer,首创波动方程建模视觉

北大清华团队在AAAI 2026 Oral论文中提出WaveFormer,首创用波动方程建模视觉。它将特征传播写成欠阻尼波动方程,实现频率 - 时间解耦,在多任务验证中速度、效率与精度全面超越。

机器之心
开源动态8

Jina-VLM:可在笔记本上跑的多语言视觉小模型

Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。

Jina AI
新闻资讯8

瓦卡奖AI视觉创意大赛·从人工智能专家跨文化对话到全球AI厂商的竞技

10月17 - 19日,第二届瓦卡奖AI视觉创意大赛在深圳举行。期间AI全球视觉工作坊汇聚专家探讨AI与艺术融合,竞技日集结全球AI视频厂商民间团队参赛。大赛还发布国内首部《AI视觉创意应用蓝皮书》。

MANA新媒体艺术站
开源动态8

社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型

Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。

Hugging Face
算法论文8

AI打通第一/第三人称视觉,跨视角视觉理解新SOTA|ICCV 2025 Highlight

INSAIT、复旦大学等联合提出ObjectRelator框架,让AI精准匹配不同视角下同一物体,实现跨视角统一表征与理解。它在Ego转Exo和Exo转Ego任务上超基线模型,已被ICCV 2025接收,代码开源。

量子位
算法论文7

The Batch: 931 | 统一视觉媒体的单一分词器

Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。

DeeplearningAI