语义ID」共找到 198 篇相关文章

算法论文8

RAE+VAE? 预训练表征助力扩散模型Tokenizer,加速像素压缩到语义提取

近期,RAE 提出以「 冻结的预训练视觉表征」作潜空间提升扩散模型性能。同期西安交大与微软亚研院提出 VFM - VAE,结合 RAE 与 VAE,能加速模型收敛、提升生成质量,展示扩散模型 Tokenizer 演化方向。

机器之心
算法论文8

Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了

Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的多实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。

量子位
产品应用7

AutoDev 预上下文引擎:预生成代码语义化信息,构建 AI 编程的知识基座

文章介绍 AutoDev 预上下文引擎,指出向量化代码检索性价比低,提出用预生成上下文提升 RAG 效果。Context Worker 能深度解析代码,支持多语言,使用简单,还可结合 MCP 服务获取上下文知识。

phodal
算法论文8

给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型

文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。

机器学习AI算法工程
算法论文8

ICCV 2025|训练太复杂?对图片语义、布局要求太高?图像morphing终于一步到位

图像处理中‘图像morphing’常见又有创意,但以往技术有训练复杂等问题。南洋理工大学等团队提出FreeMorph方法,无需训练实现图像变形,通过改进注意力机制解决特征丢失和过渡不连贯问题,实验效果佳。

机器之心
算法论文8

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。

机器之心
开源动态8

字节会师何恺明!开源连续扩散语言模型Cola DLM

字节会师何恺明,开源连续扩散语言模型Cola DLM,释出论文、代码等。该模型跳出离散token束缚,把生成过程交给连续空间,在实验中展现出稳定scaling趋势,其动机是表征而非diffusion。

量子位
算法论文7

ImageNet分数越高,生成反而越糊?iREPA给出解释

Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。

新智元
算法论文8

ACL 2026 | 别轻易给AI发「~」,它可能会删掉你的整个主目录

西安交通大学等校团队揭示大模型表情符号语义混淆安全漏洞,用自动化框架测试主流大模型,平均混淆率38.6%,多数混淆响应会“静默失败”,超半数达高危害级别。

机器之心
产品应用7

使用 Node.js + OpenAI + MongoDB 实现文本向量知识库搜索

本文介绍用 Node.js、OpenAI Embedding API 和 MongoDB 实现文本向量知识库搜索系统,涵盖环境准备、文本切分与向量存储、本地语义检索等,还提及用 MongoDB Atlas 提升性能及后续延伸方向。

AI Reading Hub