视觉大模型」共找到 9284 篇相关文章

开源动态8

5Y News|Kimi发布并开源 K2.5 模型,带来全新视觉理解、代码和Agent集群能力

2025年1月27日,月之暗面发布并开源Kimi K2.5模型,它是迄今最智能全能的模型,在多任务有出色表现。支持多模态输入,具备新能力,还推出Kimi Code工具,集群能力也开启Beta测试。

五源资本 5Y Capital
算法论文9

NUS Show Lab 寿政教授:打通自回归与离散扩散,打造下一代具身模型底座|ECCV 2026

本文整理自新加坡国立学Show Lab负责人寿政教授在ECCV 2026的分享,团队研发融合自回归与离散扩散的Show-o/Show-2统一架构,解决多模态理解与生成融合痛点,延伸至具身智能领域,突破数据稀缺、推理延迟等核心瓶颈。

AI科技评论
算法论文7

Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制

论文研究发现模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。

深度学习自然语言处理
算法论文7

GPT-6要「活」了?MIT新作曝光,AI「自进化」不远了

麻省理工学院推出全新自适应模型框架「SEAL」,让模型从「被动学习者」变为「主动进化者」。网友猜测GPT - 6可能整合其能力,成为能自主学习的模型,研究虽有局限,但为模型自进化提供新路径。

新智元
算法论文8

模型声称会“脑补”,结果被论文打脸了?潜在空间想象竟是“摆设”!

多模态模型中“潜在视觉推理”概念很火,研究者让模型在潜在空间“想象”。但清华和北交学者论文指出,潜在 Token 不关心输入、不影响输出、没信息量。作者提出 CapImagine 方案,效果远超潜在空间方法。

深度学习自然语言处理
算法论文8

GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026

近年来视觉语言模型虽推动多模态智能发展,但推理成本高昂。山东学和MBZUAI团队提出TransPrune,从演化视角衡量视觉Token重要性,保持性能无损同时降低60%推理成本。

AI科技评论
算法论文7

ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心

近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北团队用CoV-Eval评测20款主流模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试。

深度学习自然语言处理
开源动态8

最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频

今天凌晨,谷歌官宣Gemma 3n,原生支持多模态。它在模型竞技场超1300分,是首个超此分数的10B以下模型。其VRAM占用低,最低2GB,已在谷歌AI Studio等可用,还公开了技术细节。

量子位
产品应用8

每2秒吃透一道高数题!华为终于揭秘准万亿MoE昇腾训练系统全流程

华为揭秘准万亿MoE昇腾训练系统全流程,通过“昇腾+Pangu Ultra MoE”实现国产算力与模型自主可控训练闭环,从集群利用率、单节点算力、后训练技术三方面突破,实现模型高效训练。

量子位
产品应用8

Suno、Udio都被它干翻!中国AI音乐模型拿下AA全球榜单双料冠军

昆仑万维旗下 AI 音乐模型 Mureka V8,在 Artificial Analysis 榜单上登顶 vocals 和 instrumental 双榜第一,超越国际主流模型。实测亮点多,其技术进步显著,V9 也将解决表达偏差问题。

机器之心