「开源视觉模型」共找到 8933 篇相关文章
Kimi K2里找到了DeepSeek V3架构
Kimi新模型K2热度高,在多benchmark上达SOTA,网友好评多。Kimi工程师透露K2开源原因,还谈及Kimi发展策略。实测显示K2在前端制作、工具调用、创意写作上表现出色。此外,OpenAI开源模型推迟,引发猜测。
3D-R1重塑三维视觉语言推理!让三维交互更智能
近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间。
6.1B激活,三榜开源第一!蚂蚁·安诊儿医疗大模型发布
由浙江省卫生健康信息中心等联合研发的开源医疗语言模型AntAngelMed发布。它基于Ling - flash - 2.0,100B总参数仅激活6.1B达约40B密集模型性能,在多个权威医疗基准测评中居前列,采用三阶段训练流程,高效MoE架构。
对话27岁博导张林峰:模型压缩获CVPR满分有点意外,上海交大像我这样年轻老师很多
上海交大27岁博导张林峰团队在模型压缩领域成果丰硕。其提出的数据集蒸馏方法获CVPR 2025满分,还在多方面探索模型加速,成果已开源。张林峰认为数据蒸馏会成模型压缩趋势,也分享了知识蒸馏阶段看法。
AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华
随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。
“这个怎么组装?”一句无害的问题,如何让AI产生危险输出
Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。
大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026
阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。
快手&中科院 | 提出多模态奖励模型:R1-Reward,比SOTA模型提升5%-15%!
多模态奖励模型对提升多模态大语言模型表现至关重要,但现有强化学习算法用于训练存在问题。快手、中科院等团队提出 R1 - Reward,在基准上比 SOTA 提升 5% - 15%,还在快手业务场景成功应用。
OpenAI去年挖的坑填上了!奖励模型首现Scaling Law,1.8B给70B巨兽上了一课
全新奖励模型「POLAR」采用对比学习范式,摆脱对海量人工标注依赖,有强大Scaling潜力。它衡量训练与目标策略「距离」作奖励信号,用自动化合成数据预训练,小模型能超越大数十倍规模对手。
黄仁勋对话 10 位开源 AI 掌门人:未来算力将向后训练倾斜,OpenClaw 开启了现代计算机的新想象|GTC 2026
在 GTC 2026 上,黄仁勋与 10 位开源 AI 掌门人探讨开放模型。大家认为 AI 正从模型走向系统,未来算力或向后训练倾斜。OpenClaw 让大众感知到 agent,企业落地难点在治理,开放模型价值体现在可控、定制和信任。