「语义信息」共找到 829 篇相关文章
基于 Qwen3-VL-Embedding-8B 实现文搜图语义内容检索的实战教程
文章围绕Qwen3-VL-Embedding-8B模型展开,介绍其核心特性、技术架构等,提供环境搭建、模型部署指南,给出文搜图系统架构及代码实现,还通过电商、社交媒体、企业文档三个实战案例展示应用,最后讲解性能优化与常见问题解决方法。
小米在AI方向有了大动作,但AI不该是资本掩盖信息的手段。
今年下半年小米MiMo团队陆续开源多个模型,或因年初挖来技术天才罗福莉。新开源MiMo - V2 - Flash模型,总参数量309B。但小米AI对外服务网站搜自家产品舆论无果,引发对AI应坦诚审慎的思考。
RAE+VAE? 预训练表征助力扩散模型Tokenizer,加速像素压缩到语义提取
近期,RAE 提出以「 冻结的预训练视觉表征」作潜空间提升扩散模型性能。同期西安交大与微软亚研院提出 VFM - VAE,结合 RAE 与 VAE,能加速模型收敛、提升生成质量,展示扩散模型 Tokenizer 演化方向。
ICML 2025 | 大模型能在信息不完备的情况下问出正确的问题吗?
当前大语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估大模型主动推理能力,实验显示大模型主动推理能力严重不足,并指出后续拓展方向。
能查信息≠循证AI:OpenEvidence爆火在前,中国医生的「信任死结」谁来解?
AI医疗市场增长快,但国内落地面临医生信任难题。医渡科技发布的医渡智循,通过全流程技术体系、多专科智能体协作等,解决AI信任问题,实现全场景布局,让AI回归循证。
Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了
Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的多实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。
给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型
文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。
ICCV 2025|训练太复杂?对图片语义、布局要求太高?图像morphing终于一步到位
图像处理中‘图像morphing’常见又有创意,但以往技术有训练复杂等问题。南洋理工大学等团队提出FreeMorph方法,无需训练实现图像变形,通过改进注意力机制解决特征丢失和过渡不连贯问题,实验效果佳。
卧底房产AI三天后,我发现地产圈的「信息差」,正被这样一铲到底!
文章测评房产AI工具CRIC深度智联,让其与OpenAI、Google、Anthropic旗下通用AI比拼写地产研报。结果显示,CRIC以独家行业数据库实现降维打击。此外,它还有普通和专业两版,适用不同人群,也指出AI有边界。
VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。