「视觉领域」共找到 2295 篇相关文章
CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?
CoT 虽提升语言模型推理能力,但在 C 端场景有局限,且被质疑并非真实推理。视觉领域提出 CoF 概念,Google DeepMind 团队引入理论,让视频模型通过帧链推理提升帧间一致性,还具强大泛化能力。
代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放
检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。
2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道
2025 WAIC落幕,深谋科技作为精英合作伙伴首次亮相,未随波逐流,而是切入脑控、动态视觉伺服和康养场景三大底层能力领域,开拓创新赛道。其产品已商用部署,吸引众多媒体关注。
独家丨段爱国离职,不再担任依图科技总裁
依图科技总裁段爱国在朋友圈宣布离开,已获公司同意。他2023年10月加入,任职时依图业务收缩、战略聚焦。此前他是华为机器视觉总裁,推动依图多领域发展。此次变动或暗示依图困境。
告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式
传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。
The Batch: 943|液体和气体如何运动
传统数值方法模拟复杂物理系统慢且贵,基于机器学习的模拟通常只适用于特定系统。研究人员构建通用 transformer 模型 Walrus,可模拟流体运动,开源且在多方面表现出色,有望加速多领域模拟工作。
NeurIPS 2025 Spotlight | GeoSVR:稀疏体素的新潜力——超越3DGS系列的高精度三维表面重建
计算机视觉中表面重建难题待解,现有方法有瓶颈。北航等团队提出 GeoSVR 框架,围绕几何约束与表面正则化设计,在多数据集超现有方法,兼顾精度、完整性与效率,为多领域提供支持。
DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了
DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。
00后女生躲进房间造梦:我想让1000个焦虑的人,变成一只轻盈的蝴蝶
00后女孩陈栩乐是深耕VR交互领域的创作者。她以蝴蝶为具身载体,打造VR疗愈作品《Crossing the Senses》,用点云视觉呈现自然能量交换。创作中AI助力破技术难题,她追求轻交互疗愈。
击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军
在具身灵巧操作奥林匹克赛事Benjie’s Olympics中,中国具身智能公司星动纪元斩获三项全球第一,超越美国明星公司PI。其自研VLA具身模型优势显著,且已在多领域落地应用。