双视觉编码器架构」共找到 2408 篇相关文章

开源动态8

阿里Qwen悄悄放出6个开源权重,国庆卷疯了~

国庆期间,阿里通义千问悄悄放出6个开源模型权重,Qwen3-VL是通义千问系列最强大的视觉 - 语言模型。其30B版本多模态表现媲美GPT - 5 - Mini等,功能与架构均有升级。

PaperAgent
算法论文8

去掉像素中介!上海交大让AI边看边想边画,用同一个“大脑”跨模态推理

上海交大等团队提出LatentUM架构,摒弃像素解码中介,在共享语义潜空间跨模态思考。它用MBAQ技术转化视觉特征,设计MoME架构,还能自我反思、规划路线、模拟世界演变,表现出色。

AIGC开放社区
开源动态8

图像编辑太慢太粗糙?全新开源自回归模型实现精准秒级修改 | 智象未来

AI图像编辑中扩散模型有两大难题,智象未来团队提出全新自回归图像编辑框架VAREdit,引入视觉自回归架构,提升编辑精准度与速度。模型和代码已开源,还提出SAR模块优化,在基准测试表现出色。

量子位
开源动态8

DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude

DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。

AIGC开放社区
推荐文章8

从检测到通用感知:构建空间智能的基础

本文整理自张磊在AICon 2025北京的分享,分析语言与视觉原生模型架构区别,介绍基于Transformer的物体检测算法及开集检测技术进展,如Grounding DINO和DINO - X,还探讨其在多领域的应用和潜力。

InfoQ
算法论文8

ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式

本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。

机器之心
算法论文8

EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智分离"新范式

当前大视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。

深度学习自然语言处理
推荐文章7

Patreon 年度回顾中的架构经验

2025年Patreon工程团队在为超千万付费会员推新功能时重建底层设施。其年度回顾详述12个项目,提炼韧性迁移、数据模型重构、分布式系统一致性权衡三大架构主题,还分享多项目实操经验。

InfoQ
推荐文章7

InfoQ 2025 年趋势报告:软件架构和设计

InfoQ 2025 年软件架构和设计趋势报告,借助《跨越鸿沟》模型分类。涉及 AI 多方面趋势,如 LLM 普及但应用场景存疑,还有 Agentic AI、SLM 等创新领域,以及 RAG、AI 辅助开发等不同阶段趋势。

InfoQ
新闻资讯7

摩尔线程新一代GPU架构10天后发布

2025年12月19 - 20日,摩尔线程首届MUSA开发者大会将在北京举行。大会聚焦国产算力,主论坛将发布新一代GPU架构,还有20+技术专场和1000㎡科技嘉年华,官网已开放报名。

量子位