「混合视觉标记器」共找到 894 篇相关文章
数据邪修大法好:仅用文本数据就能预训练多模态大模型
多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。
Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2
Google DeepMind为Gemini 3 Flash推出Agentic Vision,让模型主动编代码操控图像,性能提升5% - 10%。该能力已上线,谷歌还计划扩展功能。这或许是受DeepSeek-OCR2刺激,两者技术路线不同。
独家丨段爱国离职,不再担任依图科技总裁
依图科技总裁段爱国在朋友圈宣布离开,已获公司同意。他2023年10月加入,任职时依图业务收缩、战略聚焦。此前他是华为机器视觉总裁,推动依图多领域发展。此次变动或暗示依图困境。
黑森林FLUX.2 Klein开源,亚秒级高质量图像生成和编辑,普通电脑就能跑
黑森林实验室发布开源的FLUX.2 Klein模型家族,是紧凑架构,将高质量图像生成与编辑速度压缩至亚秒级,在消费级显卡实现旗舰性能。其统一架构打破生成与编辑壁垒,还与NVIDIA合作优化。
谷歌重磅开源 A2UI,这将会是2026年Agentic UI的王炸级标准!
过去人和AI交互多靠文本框和语音,实际应用中存在问题。谷歌开源A2UI,是AI Agent和用户界面的中间层协议,核心是声明式JSON和客户端原生渲染,有多种能力,还给出快速入手步骤。
首个地球科学智能体Earth-Agent来了,解锁地球观测数据分析新范式
上海人工智能实验室与中山大学联合研发的 Earth - Agent 解决了多模态大语言模型用于地球科学研究的痛点。它将领域知识工具封装化,利用 LLM 智能规划调度。经 Earth - Bench 评估,其在多方面表现出色,未来发展前景广阔。
你敢信?GPT-5的电脑操作水平只比人类低2%了
Agent S3刷新了计算机使用智能体(CUA)在「OSWorld」基准测试的记录,性能达69.9%,接近人类水平。它引入bBoN实现并行扩展,还精简框架、引入原生代码智能体,已开源并发布论文。
9月全球值得一看的24件新媒体艺术作品
MANA平台9月分享24件全球新媒体艺术作品,涵盖12个国家,有创意反诈短片、未来零售空间、多媒体舞台等,涉及AI、混合现实等技术,展现艺术与科技融合,还开启投票助力创作者。
Skywork技术论坛一手分享:Agent与多模态的落地真相|甲子光年
8月19日,昆仑万维发起第一期Skywork全球技术论坛讨论会,众多高校和企业嘉宾围绕Agent与多模态展开交流。探讨了Agent商业化、多模态应用等核心问题,提出诸多判断,指出行业热度高但落地是关键。
ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力
科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。