开源动态8
Jina AI发布多语言视觉小模型Jina-VLM
Hugging Face
AI 摘要
Jina AI发布Jina - VLM,参数量2.4B,在多语言视觉问答任务表现出色。它用注意力池化解决Token爆炸问题,两阶段训练防止语言能力退化,还具备消费级硬件友好的推理效率,但在超高分辨率和多图推理有短板。
阅读原文 · Hugging Face
社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
华为IJCAI 2026论文:从规模转向设计
IJCAI 2026将召开,AI算力成本高,参数扩张边际收益低,技术创新逻辑转向‘用得更省’。华为四篇被收录论文,用精巧架构和训练策略,在四方向展现系统化工程能力,提供技术转型路径。
AI科技评论
算法论文8
单层RL训练超越全参数训练
明尼苏达大学、北大和亚马逊团队研究发现,RL收益集中在中间层,训练单层可超全参数训练。他们提出层贡献度指标,经多模型、算法、任务实验验证,还给出三种训练优化策略。
机器之心
算法论文8
NEO - ov:抛弃编码器的多模态大模型
南洋理工大学等团队推出NEO - ov模型,挑战传统「视觉编码器 + 大模型」范式,直接从原始像素学语言。它在多任务表现出色,尤其空间智能突出,但在OCR等方面有短板,展现原生多模态建模潜力。
机器之心
算法论文8
新国立ViF:终结多智能体视觉幻觉“滚雪球”
多智能体协同做视觉任务常轮次越多错得越离谱,根源是信息传递方式有缺陷。新国立等研究人员提出轻量通用的ViF范式,无需改造基座模型,可大幅压制幻觉滚雪球,已入选ICLR 2026。
量子位