开源视觉模型」共找到 8933 篇相关文章

算法论文8

统一视觉多模态与多任务!快手可灵与港科大团队发布视频生成模型,加速真实世界理解

港科大、港中文、清华和快手可灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实可控,还实现零样本泛化,在多任务表现优异。

量子位
开源动态8

5B参数+4060Ti,10秒出图,全流程开源可复现!补齐统一多模态生成编辑的开源版图,让高质量图像生成真正变得更轻量、更普及

近日,多机构联合发布统一多模态生成编辑模型DeepGen 1.0,仅5B参数,集成五大能力,4060ti 16G上10秒出图,多项指标超大4倍工业级模型。团队开源全流程代码与数据,可从零复现。

量子位
开源动态8

国产开源LLM迎来大爆发的一周:Kimi、腾讯、快手、美团、面壁智能

国产开源模型迎来爆发,快手、月之暗面、美团、面壁智能、腾讯等接连发布新模型,如快手Keye-VL - 1.5 - 8B刷新视频理解SOTA,美团LongCat - Flash - Chat推理快成本低等。

PaperAgent
开源动态8

小红书开源模型dots.llm1,初次出手,小有惊艳!国外网友们又炸了……

小红书hi lab团队公布首个开源模型dots.llm1,这是142B参数的MoE模型,仅14B激活参数就能与Qwen2.5 - 72B打平。它开源力度大,训练效率高,数据处理精细,训练稳定,获国外网友高度关注。

AGI Hunt
开源动态8

蚂蚁开源 x SGLang Meetup技术回放解读系列之面向DeepSeek系列模型的深度优化与实践

文章是对蚂蚁开源x SGLang Meetup中「蚂蚁Theta面向DeepSeek系列模型的深度优化和实践」分享的解读,详细介绍了在H20-96G上对DeepSeek系列模型推理的优化方案,包括Prefill和Decode阶段的优化、通信优化、观测诊断等,并给出了评测结果。

GiantPandaLLM
开源动态8

重磅开源!首个全异步强化学习训练系统来了,SOTA推理大模型RL训练提速2.77倍

清华大学和蚂蚁技术研究院联合团队开源全异步强化学习训练系统 AReaL-boba²,坚持“全面开源、极速训练、深度可定制”理念,实现异步 RL 训练,训练速度最高提升 2.77 倍,支持多轮智能体强化学习训练。

机器之心
开源动态8

通义实验室正式开源 Mobile-Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI-Owl-1.5

通义实验室正式开源 Mobile - Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI - Owl - 1.5。该模型有多档参数可选,分 Instruct 和 Thinking 版,支持多平台。它解决了高质量数据难搞定等痛点,评测表现良好。

深度学习自然语言处理
开源动态7

OmniAvatar震撼开源!阿里夸克开源全新音频驱动角色模型

音频驱动人体动画技术有局限,阿里夸克团队推出OmniAvatar模型。它用逐像素多层次音频嵌入和LoRA训练法,解决唇动同步等问题,适用于多领域,但也存在颜色偏移等不足。

带你学AI
算法论文8

VLM 实现 10%的精度提高,13.1倍加速!纽约大学新算法让视觉语言模型更小、更快、更准确

纽约大学研究团队用QSVD新方法让视觉语言模型(VLM)效率飞跃,在普通GPU上实现13.1倍加速。它将Q、K、V矩阵捆绑处理,设计秩分配策略,引入量化方案,经多模型评估,展现出低硬件成本、高精度优势。

AIGC开放社区
开源动态8

刚刚,首个空间原生的具身视觉基模开源!机器人更会看我们的世界了

蚂蚁灵波发布并开源了面向机器人真实任务的空间原生视觉基模 LingBot-Vision 及空间感知模型 LingBot-Depth 2.0,能让机器人更精准地感知世界,解决透明反光材质、小目标和远距离目标等视觉难题。

量子位