「视觉语言融合」共找到 2036 篇相关文章
深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来
本文深入解读“世界模型”,虽无明确定义,但从目的出发分为表征和生成两类。前者含生物大脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。
Google Design.md:一键复刻60+大厂设计规范 | 设计界的事,能叫偷吗?
今天分享Google Stitch团队提出的DESIGN.md标准,单文件搞定网页设计。62个真实网站视觉语言对应的DESIGN.md可在https://getdesign.md/获取,它也是开源项目。放入项目根目录后,AI编程助手可读取生成风格一致的UI组件。
真正的一句话修图:Gemini 用香蕉模型给出了图像生成的分水岭
Google新模型Gemini 2.5 Flash Image可在AI Studio体验。它有多图融合、角色一致性等能力,能实现自然语言编辑图像,速度快、价格低、API可用,虽有中文体验等问题,但有望让AI视觉工具进入工程化时代。
第一章:AI 技术前沿全景
文章聚焦AI Agent技术前沿,阐述大语言模型三次能力跃迁,从涌现能力到对齐指令遵循,再到推理与行动。还提及Scaling Law变化,推理时计算扩展更划算,介绍代表性推理方案及多模态融合,指出Agent打破传统对话AI局限。
Java 世界的 MCP:将架构策略应用于 LLM 集成
文章指出大语言模型成企业架构组件,但当前集成脆弱。MCP 引入标准化方法,Java MCP SDK 能将其与企业架构融合。文中探讨 MCP 及其 SDK,分析其设计、应用、权衡等,还给出企业运营助手案例。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini
DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。
Java 世界的 MCP:将架构策略应用于 LLM 集成
文章指出大语言模型成企业架构组件,但当前集成脆弱。MCP 引入标准化方法,其 Java SDK 重要。文中介绍 MCP 架构、特点,分析其与原生工具调用的权衡,还通过案例展示应用,最后说明适用场景。
小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!
文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。
OpenVision 2:大道至简的生成式预训练视觉编码器
多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。