「视觉分析」共找到 1718 篇相关文章
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!
Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时后,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。
镜头被油污糊住,机器人还稳定操作?北大/清华等给VLA加一道信息筛选,不靠额外数据,效率提升14x,真机鲁棒性反而更高了 | ICML 2026
北大、清华等机构联合提出StableVLA,相关工作被ICML 2026接收。该工作提出轻量级IB - Adapter,不依赖额外数据对视觉特征筛选对齐,让机器人遇视觉干扰仍能稳定执行任务,实验展现出鲁棒性提升。
告别传统 Text-to-SQL:基于 Spring AI Alibaba 的数据分析智能体 DataAgent 深度解析
企业数字化转型中,业务人员受 SQL 语法限制,Text-to-SQL 也有不足。DataAgent 基于 Spring AI Alibaba 生态而生,能输出带图表、逻辑和洞察的报告,还通过多项核心技术解决企业数据决策难题。
3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!
文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。
自媒体误读了 DeepSeek-OCR:一图胜千言
近期,DeepSeek-OCR引发关注,但很多媒体误读其为OCR工具,实际是视觉语言模型。它是为大文档等场景优化的视觉压缩与识别系统,架构新颖,训练讲究,效果出色,为行业带来新思路。
迈向可编程观测:在GPU Kernel中构建类eBPF风格的性能探针
文章从CUDA基础讲起,以矩阵乘法为例介绍性能调优,再到PTX汇编知识,最后引入Neutrino框架构建可编程GPU性能探针。展示了GPU Kernel性能分析从宏观到微观的技术演进,提供新分析视角。
从需求分析到代码生成,LLM都能干点啥?一文读懂291个软工Benchmark!
大语言模型重塑软件工程各环节,但缺乏评估其在该领域表现的系统工具。浙江大学等机构团队首次对291个软件工程Benchmark系统综述,分析现状、痛点并给出改进方向。
Google | 溯源分析RAG系统错误,提出选择性生成框架,让RAG问答准确率提升10%
Google对RAG系统错误深入分析,引入‘充分上下文’概念,指出幻觉或因上下文不足。构建评估器,提出选择性生成框架,结合多信号决策,实验显示可让RAG问答准确率最高提升10%。
参数量暴降,精度反升!哈工大宾大联手打造点云分析新SOTA
哈工大(深圳)和宾大联合团队推出基于KANs的3D感知解决方案PointKAN,能处理点云数据下游任务。它替代MLP,有更强学习几何特征能力。还提出PointKAN - elite,降参保量。实验表现出色。