「Qwen3-Embedding」共找到 2172 篇相关文章
更快更省!Vidu Q3硬核升级打响AI视频普惠第一枪 | 甲子光年
2026年AI视频行业内容产出增长迅猛,但成本上涨、生成慢等问题凸显。生数科技的Vidu Q3模型全面升级,生成速度提升5倍、价格降低,适配多场景,为AI视频普惠工业化提供范例。
一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”
NVIDIA 推出多模态大语言模型 OmniVinci,结合架构创新与数据合成流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发争议。
Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型
本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。
文档解析OCR全新升级,追平Gemini2.5pro,超越MinerU、碾压Qwen2.5VL-72B
CourseAI介绍PP - StructureV3实战、能力、性能与架构。它在通用版面解析等方面能力强,更新PP - OCRv5提升准确率,超主流OCR方案,轻且速度快,但遇特殊情况需重新训练。
腾讯混元图像3.0开源榜一,工业级800亿参数可商用,附提示技巧
28日,腾讯开源800亿参数的工业级原生多模态生图模型HunyuanImage 3.0,个人和月活≤1亿公司可免费用。它是全球参数量最大、性能最好的开源图像生成模型,技术强、评估表现优,官方还整理了提示词手册。
全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案
随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力。
阿里通义新年礼物:开源最强Qwen-Image-2512版本告别AI塑料感与文字乱码
通义万相新年前发布Qwen - Image - 2512版本。它是开源界最强文生图模型,在AI Arena盲测中表现出色。能消除AI塑料感,攻克文字渲染难题,在还原真实世界和重构视觉元素逻辑排版上有显著提升。
ACMMM 2025 | 北大团队提出 InteractMove:3D场景中人与可移动物体交互动作生成新框架
北大团队在ACMMM 2025发布InteractMove,首次提出含可移动物体3D场景中基于文本的人 - 物交互生成任务,构建数据集与创新框架,在多指标领先,代码与模型已开源。
YOLO12改进引入DINOv3少样本目标检测精度飙升,分享训练自定义数据集代码
Meta 人工智能研究院的 DINOv3 是基于自监督学习的视觉大模型,解决诸多问题且无需微调,在多任务表现出色。将其引入 YOLO12 后,在不同规模数据集上检测性能显著提升,还分享训练自定义数据集代码。
定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%
谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。