多模态混合检索」共找到 1344 篇相关文章

算法论文8

攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产

新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。

机器之心
开源动态8

HumanSense:探索多模态推理边界,打造「察言观色会共情」的全模态交互伙伴

蚂蚁集团与西安交通大学联合提出并开源 HumanSense,含评估基准与推理模型。通过细粒度评测、全模态消融等研究,提出优化策略,项目已在 GitHub 和 HuggingFace 开源,推动 AI 交互体验革新。

机器之心
开源动态8

阿里开源Mobile-Agent-v3:多模态GUI智能体,实现跨平台自动化突破!

全新自动化时代,GUI智能体融入日常。阿里巴巴通义实验室推出GUI - Owl与Mobile - Agent - v3,实现跨平台自动化突破。文章解析其发展历程、技术创新,且项目开源,商业化潜力引关注。

AIGC开放社区
产品应用8

阶跃星辰发布新一代基模 Step 3,原生多模态推理模型,性能达到开源 SOTA

WAIC 2025期间,阶跃星辰上线新一代基础大模型Step 3,7月31日将面向全球开源。还成立“模芯生态创新联盟”,与上海国有资本投资有限公司合作。Step 3性能达开源SOTA,推理效率高,适配多种芯片。

Founder Park
新闻资讯7

多模态扩散模型开始爆发,这次是高速可控还能学习推理的LaViDa

近期基于扩散模型的视觉 - 语言模型 LaViDa 出现,它继承扩散语言模型优点。与自回归模型不同,扩散模型能并行、处理双向上下文。LaViDa 在多任务测试有竞争力,推理蒸馏和文本填空表现好,还能权衡速度与质量。

机器之心
开源动态8

Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的

本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。

通义千问Qwen
产品应用8

探索 GPU 加速向量检索:NVDIA Cagra 在微信大规模推荐系统中的应用实践

本文分享腾讯团队将 Cagra GPU 图索引大规模应用于微信核心线上推荐业务的实践。介绍 Cagra 算法原理与优势,讲述线上化改造、架构演进、CPU/GPU 协同优化等,展示业务落地显著收益。

腾讯技术工程
开源动态8

斩获7.4K标星!NotebookLM的终极开源平替,私有化多模态播客一键生成!

Google的Notebook LM虽能上传资料一键生成播客总结,但有数据隐私等问题。近期GitHub上的Open Notebook获7.4K标星,它复制并超越前者功能,强调数据主权,有多项亮点且部署灵活。

开源星探
产品应用7

别让Nano Banana骗了!混合方案让头像生成成功率从0到100%

作者用Nano banana更新头像时发现其生成中文能力差,提出将AI画图与HTML编程结合的方案。HTML搞定确定性、成本低部分,AI画图负责复杂、创意性高部分,还给出使用方法及多种头像加字设计方案。

AI 产品自由
开源动态8

轻量级易开发,8B参数释放大实力!科学多模态模型Intern-S1-mini开源

上海人工智能实验室继7月26日开源后,推出轻量化版本Intern-S1-mini。它是8B参数“迷你模型”,兼具通用与专业科学能力,适合快速部署和二次开发,在多方面表现出色,还降低了对高端计算设备依赖。

OpenMMLab