「多模态长文档视觉问答」共找到 1659 篇相关文章
DeepSeek睁开眼了!Opus-4.8的性能,1000张图不到20美分
DeepSeek首个多模态视觉模型deepseek-v4-flash-vision-exp上线DeepSeek API平台。文本能力与V4-Flash持平,多模态Agent能力逼近Opus-4.8,分析1000张图成本不到20美分,还上线免费Files API。
GLM4.5之后,智谱又开源GLM-4.5V,实测下来视觉推理能力贼强~
智谱继GLM-4.1V-9B-Thinking、GLM-4.5后,又开源最强多模态推理模型GLM-4.5V,在多模态理解榜单达开源SOTA。它视觉推理强,经测试能助力科研各阶段,还介绍了其架构设计与训练策略。
突破视觉仿真算力瓶颈!新一代具身智能仿真框架开源:高吞吐并行高保真渲染助力规模化训练
具身人工智能向以视觉为中心转型,但面临“看得真”和“训得快”难题。清华大学智能产业研究院等提出GS - Playground通用多模态仿真框架,融合高吞吐量并行物理仿真与高保真视觉渲染,成果被RSS 2026录用,将开源。
一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一
文档OCR正迈入小模型时代,MonkeyOCRv2以0.7B、0.6B参数在MDPBench上超越3B模型。它重新分配系统职责,采用互补预训练目标,还开源训练数据,且迁移到多任务表现良好。
松下发布多模态大模型,文本、图像、音频随意切换
多模态数据处理成热点,但现有模型处理复杂任务有挑战。松下开发多模态大模型OmniFlow,采用模块化设计、多模态引导机制,实验显示其在多任务中有卓越表现。
OpenAI机密文档再泄露:2026年神秘硬件设备曝光!
Internal Tech Emails曝光OpenAI内部文档,显示2026年将推出神秘设备,还放出ChatGPT 2025年上半年战略文档。网友猜测设备用途,靠谱分析指可能是AI硬件。文档揭示其全场景AI野心、技术架构升级及品牌战略思考。
DeepSeek多模态真的来了?识图模式已开始小范围灰度
4月29日,DeepSeek多模态团队负责人陈小康在X发布动态暗示多模态进展。部分用户在DeepSeek官方App灰度到“识图模式”,这是其主线产品首次有图像理解能力模式,此前多模态人才有流失,官方未说明开放细节。
刚刚,商汤内部两万字复盘曝光:多模态通往AGI核心路线首次公开
商汤科技联合创始人林达华撰写万字长文,剖析将「多模态通用智能」视为技术战略核心引擎的原因,探索组织及战略层面的思考。文章回顾商汤多模态之路,探讨多模态通向AGI的原因、构建路径等关键问题。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。
Mintlify 做的开发者文档,如何成为 Coding Agent 生产和消费的第一波内容?
Mintlify 是 AI-native 开发者文档工具,抓住“文档读者从人类扩展到 agent”的变化,提供美观文档站和 agent 友好功能。今年 4 月完成 4500 万美元 B 轮融资,但面临竞争,优势或被稀释。