「视觉精准度」共找到 1230 篇相关文章
ICML 2025|趣丸研发新型人脸动画技术,声音+指令精准控制表情
广州趣丸科技团队提出新颖肖像驱动框架Playmate,能根据音频和控制条件生成高质量肖像视频,精准控制表情和姿态。成果被ICML 2025收录,代码开源筹备中,在多方面优于现有方法。
视觉模型既懂语义,又能还原细节,南洋理工&商汤提出棱镜假说
南洋理工与商汤团队提出 Prism Hypothesis(棱镜假说)与 Unified Autoencoding(UAE)。论文指出视觉基础模型中语义理解和像素保真很难兼得,用频率谱统一视角解决冲突,UAE 实验效果良好。
拒绝「盲修」:JarvisEvo 如何让 Agent 像人类一样拥有「视觉反思」能力?
现有 Image Editing Agent 缺乏视觉反馈,易致「指令幻觉」和 Reward Hacking。JarvisEvo 应运而生,它通过 iMCoT、SEPO、On - Policy Reflection 等技术,结合 ArtEdit 数据集和三阶段训练,在修图上表现出色,意义超图像编辑。
内存直降50%,token需求少56%!用视觉方式处理长文本
在NeurIPS 2025论文中,南京理工大学等校研究团队提出VIST框架,为大语言模型长文本高效推理提供视觉解决方案。它模仿人类阅读机制,让模型具备选择性阅读能力,减少Token需求和内存使用。
港中文联手美团开源“视觉推理通才”!图像视频10类任务一网打尽
香港中文大学MMLab与美团研究团队开源OneThinker模型,它可覆盖图像与视频十类核心视觉任务,在31项测试中表现出色,还展现泛化能力。研究团队搭建数据集,并引入EMA - GRPO算法提升训练稳定性。
pdf2skill:让计算机视觉初学者把PDF文档变成AI技能包
pdf2skill技术是“文档转技能编译器”,能将PDF知识转化为AI可调用技能包。它解决了计算机视觉研究和工程中的痛点,介绍了原理、实战案例、代码实现,还对比性能、给出使用指南。
YOLO26(极速目标检测) + SAM3(精准掩码生成) 搭建一套实用的流水线
文章介绍用 YOLO26 极速目标检测和 SAM3 精准掩码生成搭建流水线。阐述二者原理,给出环境配置、实战代码,分析结果,还介绍进阶优化技巧和常见问题解决方案,适合实时应用场景。
Apple | 开源视觉语言模型:FastVLM,可手机运行,首token速度提升 85 倍
苹果开源能在 iPhone 上运行的视觉语言模型 FastVLM,代码仓库含 iOS/macOS 演示应用。它解决体积和速度问题,首 token 输出速度提升 85 倍,引入 FastViTHD 编码器,适配 iOS/Mac 生态,有不同参数量级版本。
JanusVLN:双重隐式记忆解耦语义与空间,开创视觉语言导航记忆新范式
视觉 - 语言导航(VLN)现有主流方法依赖显式记忆面临挑战,未充分利用3D线索。JanusVLN框架引入双重隐式神经记忆,解耦语义与空间信息,实验验证其性能、效率和泛化能力出色。
月之暗面刚开源多模态Kimi-2506:智能体、视觉理解,重磅大升级
国内月之暗面平台对开源多模态模型Kimi-VL-A3B-Thinking升级到2506版本。该版本性能、视觉理解等能力提升,支持更高分辨率,在多领域表现出色,还介绍了模型组成与优化器改进。