「视觉空间」共找到 1095 篇相关文章
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。
CVPR 2026 视频模型趋势梳理:不止生成下一帧,更要理解下一步
视频智能正从画面生成走向运动控制、动态建模等。CVPR 2026 显示视频模型竞争重心从视觉质量转向对时空和物理规律的建模能力,文中介绍多篇相关论文及成果。
GPT-5.2发布,OpenAI十周年纪念版更新。
OpenAI在成立十周年之际发布GPT-5.2。此次更新让其在真实工作场景更实用,包括PPT/表格制作能力升级、前端编码能力惊艳、视觉能力细节处理更强、工具调用意识领先等。
字节跳动Seed1.5-VL复杂图表精准抽取,Deep Think是多模态未来的主流
文章介绍字节跳动的Seed1.5-VL模型,它能精准抽取复杂图表,处理模糊图片、推理几何题。其由视觉编码器和LLM组成,预训练语料丰富,后训练结合多种方法,推荐在huggingface体验。
60000小时炼出新开源VLA!20多种机器人都能用
蚂蚁灵波发布开源VLA模型LingBot-VLA 2.0,用60000小时预训练数据“喂”出。它支持20多种机器人构型,融合LingBot-Depth提升空间理解,还学会预测未来,在GM - 100评测表现佳。
AI 浏览器还没捂热,给 Agent 用的浏览器已经来了:Ego Lite
最近出现了给 Agent 用的浏览器 Ego Lite。与给人类用的 AI 浏览器不同,它让浏览器成为 Agent 工作台,有隔离任务空间,不打扰用户,解决了任务和执行环境间的距离问题。
谷歌机器人大脑又进化了。成功率飙3倍,还能看表干活、保护自己
Google DeepMind发布机器人大脑Gemini Robotics ER 1.6模型,提升机器人空间感知、多视角解析与仪表读取准度,具精准指认、读表能力,还提高操作安全性与合规度,开发者可通过Gemini API等使用。
谷歌AGI底座降临!首个原生全模态嵌入模型上线,已实现全模态SOTA
谷歌发布首个原生全模态 Embedding 模型 Gemini Embedding 2,将文本、图、音视频及 PDF 融于统一向量空间,实现跨模态检索,降低架构成本,赋予 AI 连贯「记忆」,是重塑 AI 基建的里程碑。
豆包也开始抢程序员饭碗了,首个编程模型来了!
字节给豆包升级编程能力,推出首款编程模型Doubao - Seed - Code。它刷新国内编程模型上下文长度,支持视觉理解,API价格良心。经测试,虽未达全球顶尖,但弥补国产编程模型短板。
腾讯重磅开源:端到端文档转换VLM,中英文错误率双料最佳!
腾讯开源端到端文档转换视觉模型POINTS - Reader,可将文档图片转结构化文本。它基于POINTS1.5架构,支持中英文。在OmniDocBench基准上,中英文错误率暂列最佳,具零后处理简单等亮点。