「视觉大模型」共找到 9344 篇相关文章
首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」
当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。
LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收
LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。
一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率
DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。
首个地球科学智能体Earth-Agent来了,解锁地球观测数据分析新范式
上海人工智能实验室与中山大学联合研发的 Earth - Agent 解决了多模态大语言模型用于地球科学研究的痛点。它将领域知识工具封装化,利用 LLM 智能规划调度。经 Earth - Bench 评估,其在多方面表现出色,未来发展前景广阔。
Mistral 3发布,14B多模态小模型表现优异
Mistral AI第三代模型发布,含三个小型密集模型和稀疏混合专家模型Mistral Large 3,全用Apache 2.0许可。有多项技术亮点,Ollama等支持部署微调,还给出实用配置建议。
“AI版LeCun”自己讲解论文,自我进化智能体框架生成精美演讲视频
加州大学研究者提出自我进化的学术演讲智能体框架EvoPresent,它由四个智能体协作,核心美学模型PresAesth模拟人类审美判断。团队构建评测体系,实验显示其在内容与视觉设计上提升显著,让AI兼顾逻辑与美感。
微软这支神秘的华人AI团队加入腾讯混元,曝与裁员无关|独家
WizardLM项目创建者徐灿发文称团队离开微软加入腾讯混元。混元此前发布多款AI模型,WizardLM也发布过混元模型。该团队专注高级大语言模型开发,曾成绩斐然,但也面临模型部署挑战。腾讯大力投入AI,网友对此看法不一。
基于DINOv2和SAM2改进的U-Net模型
DSU-Net是基于DINOv2和SAM2改进的U-Net模型,通过多尺度跨模型特征协作和轻量级适配器模块,解决现有图像分割模型在特定下游任务表现不足问题,提升分割精度,降低训练成本。
世界模型==VQA?机器人不用想象画面,预测语义就够了
华盛顿大学、索尼AI研究者在新论文中质疑机器人世界模型是否需想象精确未来画面。指出多数模型还原画面不适合决策,提出语义世界模型SWM,能预测未来语义信息,实验效果良好。
DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini
DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。