「多模态RAG」共找到 1104 篇相关文章
Google Gemini Embedding2:一个模型处理所有媒体类型
Google发布Gemini Embedding 2,首个原生多模态嵌入模型。能处理文本、图像等多种媒体类型,支持交错输入,覆盖超100种语言。与多模型串联方案比,延迟降70%、召回率升20%。已可在Gemini API等使用。
港中文 MMlab×美团新研究:仅用一个模型,应对多种视觉推理任务
港中文 MMLab 与美团联合提出 OneThinker 多模态统一推理模型,将多种视觉任务抽象为‘先推理、后作答’形式,通过多任务强化学习优化。实验显示其在多任务表现佳,为通用视觉推理模型提供参考。
刚刚,AI视频的天花板被掀翻!测完SkyReels后飘了:我亦有成为专业导演的潜质
昆仑万维官宣上线全新一站式多模态AI视频创作平台SkyReels,同步发布模型SkyReels V3并优化多能力。实测其画布、Agent等功能玩法多,还打通多模态边界,将巩固昆仑万维地位,加速人人专业创作愿景到来。
AI不再「炫技」,淘宝要让技术解决用户每一个具体问题
技术发展迅速,淘宝力求将AI融入应用场景解决用户问题。今年3月升级AIGX技术体系,近日郑波公开淘宝全模态大模型进展,认为狭义AGI或5 - 10年到来,多模态智能成关键技术域。
基于Spring AI Alibaba 的 DeepResearch 架构与实践
本文基于 SpringAI Alibaba Graph 构建 Java 版 DeepResearch 系统,实现信息搜集到报告生成的全自动流程。介绍系统能力、架构、核心功能节点及技术点,还阐述 RAG、搜索、MCP、报告生成等功能,给出使用、部署和社区参与方式。
VaseVQA:考古领域实现专家级,诊断+补弱RL框架
在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
763亿港元,大模型公司最大规模IPO!MiniMax登陆港交所,开盘前大涨50%
MiniMax正式在港交所主板挂牌上市,股票代码“00100”。此次全球发售约3358万股,募资约55.4亿港元。市场认购热烈,早盘一度涨幅超50%,市值突破763亿港元。其技术多模态齐发,组织高效,为行业提供新样本。
低延迟、高吞吐,LLM优化与高效推理引擎综述
LLM计算成本高,用户要低延迟,企业要高吞吐。工程师开发优化技术,如动态批处理、KV缓存、模型量化。论文对比25款推理引擎,还探讨了多模态支持、手机端推理、新型架构支持等进化方向。
OpenClaw 3.24发布:彻底解决最重要的Skills安装障碍!
OpenClaw 3.24 发布,改动显著。Skills 安装更顺滑,系统自动检测依赖;控制台界面大改,侧边栏更易用;修复媒体文件访问漏洞;Microsoft Teams 支持升级;还修了多平台群聊 Bug,新增 API 端点,提升 RAG 兼容性。