「多模态视觉作品」共找到 1464 篇相关文章
AAAI 2026杰出论文奖 | ReconVLA:具身智能研究首次获得AI顶级会议最佳论文奖
具身智能常被视为‘系统工程驱动’研究方向,ReconVLA获AAAI杰出论文奖,是具身智能方向首次获AI顶级会议最佳论文。它解决VLA模型关键瓶颈,通过重建式隐式视觉定位机制,实验效果显著。
从BERT到T5再到Qwen3:关于Embedding的八点总结
哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。
3D-R1:让AI理解3D世界的下一步
文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。
Qwen3.8-Flash:全新架构,更强更稳更划算
本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。
字节Seed团队发布Seed1.5-VL,用仅20B活跃参数在60个主流测试中狂揽38项第一!
字节Seed团队发布Seed1.5-VL,仅200亿活跃参数就在60个主流测试中获38项第一。介绍其架构、预训练、后训练等情况,评估表现出色,虽处理复杂场景有局限,但仍在多模态任务取得显著进展。
快手可灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了
ChatGPT发布三周年,快手可灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。
Rex-Omni:用 3B 模型颠覆目标检测
长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。
ImageNet作者苏昊被曝任教复旦
ImageNet作者之一苏昊被曝要去复旦任教。他是具身智能领域论文被引次数最高的华人学者,主导多个奠基级项目。他研究从语言到2D、3D视觉,再到机器人,还创办具身智能公司Hillbot。
腾讯混元发布并开源图像模型 2.1,支持原生 2K 生图
9月9日深夜,腾讯发布并开源混元生图模型“混元图像2.1”,支持原生2K高清生图,综合能力领先。它在多方面升级,有诸多亮点,评估显示效果优,还同步开源文本改写模型,能满足多样视觉需求。
碾压小扎!22岁成亿万富翁,2025年AI造富速度刷新人类认知
2025年AI成超级造富机,将50多位创始人送入亿万富翁俱乐部。从大模型到应用层,AI渗透生活。巨额融资不断,巨头砸钱建基建,人才争夺激烈,多模态初创公司也受青睐,职场AI使用比例上升。