「图像检索」共找到 710 篇相关文章
一个模型超了DeepSeek R1、V3,参数671B,成本不到350万美元
Deep Cogito 是旧金山 AI 初创公司,开源四款混合推理模型。最大 671B MoE 模型性能超 DeepSeek v3 等,推理链比 DeepSeek R1 短 60%,训练成本不到 350 万美元。核心方法是迭代蒸馏与增强。
Jina Embeddings v4 的量化感知训练
文章聚焦Jina Embeddings v4的量化感知训练。介绍量化技术可压缩向量体积、提升检索效率,对比四种主流量化方法,重点实验PTQ和Output QAT,还测试非对称量化,给出实验结果与结论。
开源Agent新标杆:通义WebSailor多榜夺魁,挑战OpenAI高难度Agent基准BrowseComp
信息爆炸时代,传统搜索引擎难满足需求,开源Web Agent在极端复杂任务表现不佳。阿里巴巴通义实验室推出WebSailor,通过创新数据构造和训练方法,在BrowseComp等挑战上取得突破,缩小与顶级封闭系统差距。
刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3
互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。
强化学习也能预训练?效果可提升20倍,华人新作引爆RL新范式!
伯克利团队提出新方法InFOM,不依赖奖励信号,能在多任务中超强迁移与推理。在36个基于状态和4个基于图像的任务测试中,InFOM表现出色,在jaco任务上改进达20倍。
Labubu换装记!让视频换装变得如此简单!基于扩散Transformer的视频虚拟试衣新突破
今天介绍开源项目MagicTryOn,它是基于大规模视频扩散Transformer的视频虚拟试衣框架,能实现高质量视频换装。采用三项关键技术创新,支持图像、视频试衣及定制化方案,目前仍在积极开发。
这张信息图,居然是8B开源模型做的??
商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。
YC CEO把自己第二大脑系统开源了:专供OpenClaw与Hermes,全息记忆打造迷你AGI
YC总裁Garry Tan开源第二大脑系统GBrain,可让AI agent拥有持续成长的知识库。它将各类信息汇入可检索知识库,每轮对话让agent更聪明,适用于OpenClaw和Hermes Agent,有多种使用路径。
谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...
谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。
多尺度特征融合:原理、结构与实用算法案例
文章介绍多尺度特征融合技术,它结合网络不同层次特征以捕获丰富上下文信息,在目标检测等任务广泛应用。阐述原理、常用方法,介绍FPN、U - Net等结构,并给出基于这些结构的实用算法案例与Python代码。