图像检索」共找到 710 篇相关文章

产品应用8

探索 GPU 加速向量检索:NVDIA Cagra 在微信大规模推荐系统中的应用实践

本文分享腾讯团队将 Cagra GPU 图索引大规模应用于微信核心线上推荐业务的实践。介绍 Cagra 算法原理与优势,讲述线上化改造、架构演进、CPU/GPU 协同优化等,展示业务落地显著收益。

腾讯技术工程
产品应用8

阿里Qwen-Image-2.0图像生成与编辑巅峰汇合,超真实、超强图文结合

阿里Qwen - Image - 2.0将生图与编辑能力合二为一。它支持长指令,能精准渲染大量文字,引入物理逻辑让文字呈现真实质感,在生图和编辑上对语义理解和画面重构能力强。

AIGC开放社区
算法论文8

相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作

S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。

量子位
开源动态8

不看后悔!GitHub 开源 MultiTalk .8k star 强大的人语音+图像绑定项目

MultiTalk 是 MeiGen‑AI 开发的开源框架,可从音频、图片和提示语生成多人对话视频。它解决传统视频制作痛点,功能亮点多,技术优势明显,应用场景广,与同类项目对比表现突出。

小华同学ai
算法论文8

DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!

4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。

花叔
算法论文8

只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max

现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。

机器之心
产品应用7

别再错过啦,AI Agent记忆革命:95.2%检索率的持久记忆系统深度解析

agentmemory是为AI编码Agent打造的持久记忆系统,能自动捕获操作上下文,有三层搜索与四层记忆架构。支持12+种主流AI Agent,有全平台覆盖、零外部依赖等优势,虽有局限但值得开发者一试。

小华同学ai
开源动态8

代码检索新王登基!CodeFuse | 开源C2LLM,用“注意力池化”刷新MTEB-Code榜单

蚂蚁集团与上海交通大学推出C2LLM系列模型,基于注意力创新池化机制解决代码表征痛点,登顶MTEB - Code榜单。作为CodeFuse Embedding开源家族成员,将全套回馈社区,为代码大模型研发提供基线。

AINLPer
产品应用7

Google 推出了免费 Vibe Coding 工具,一键集成聊天、视频、图像AI,真的很氛围。

谷歌推出免费 Vibe Coding 工具,集成多种 AI 功能。谷歌 AI Studio 的 Built 模式更新,能混合匹配 AI 功能,自动连接模型和 API。用户无需了解 API 文档,可快速做出 MVP,谷歌 AI API 免费(限速)。

AI进修生
算法论文8

图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心