多模态知识图谱」共找到 1408 篇相关文章

开源动态7

1.5B参数!支持本地实时语音转录

Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。

AI工程化
新闻资讯8

763亿港元,大模型公司最大规模IPO!MiniMax登陆港交所,开盘前大涨50%

MiniMax正式在港交所主板挂牌上市,股票代码“00100”。此次全球发售约3358万股,募资约55.4亿港元。市场认购热烈,早盘一度涨幅超50%,市值突破763亿港元。其技术多模态齐发,组织高效,为行业提供新样本。

量子位
算法论文8

Multi-Agent记忆系统MIRIX:比RAG性能飙升35%,存储减少99.9%

现有AI Agent记忆方案有局限,MIRIX作为模块化多智能体记忆系统应运而生。它由六种记忆类型和多智能体框架组成,支持多种检索功能。在多模态和单模态测试中表现优异,为记忆增强型LLM智能体设新标准。

PaperAgent
新闻资讯7

飞书正在赌一件事:谁先把Agent塞进工作流,谁就是下一代Office

飞书2026年战略转向Agent平台,让Agent成工作流原生组件。以知识问答为切入口,与钉钉、企业微信展开AI路线竞争。其投入MCP基建,押注人与Agent协作,也面临商业化、客户结构等挑战。

AI Reading Hub
产品应用7

Qwen3.6-Max-Preview来了!

继Qwen3.6 - Plus发布,推出Qwen3.6 - Max - Preview预览版,相比前者有更强世界知识、指令遵循能力,智能体编程表现显著提升。可在Qwen Studio交互,也将通过阿里云百炼API调用。

千问大模型
开源动态8

重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!

传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。

开源星探
算法论文8

大模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮

北邮研究团队通过思维链审计实验,揭示大模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。

量子位
算法论文7

低延迟、高吞吐,LLM优化与高效推理引擎综述

LLM计算成本高,用户要低延迟,企业要高吞吐。工程师开发优化技术,如动态批处理、KV缓存、模型量化。论文对比25款推理引擎,还探讨了多模态支持、手机端推理、新型架构支持等进化方向。

深度学习自然语言处理
开源动态8

DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro

DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。

AI寒武纪
推荐文章8

Physical Intelligence 核心技术团队分享:物理世界的“Vibe Coding”如何实现?

Physical Intelligence 核心技术团队解读机器人技术路径,分享前沿探索。介绍 VLA 与 VLM、LLM 关系,还提及 PI 构建数据管线、提出“知识绝缘”机制,分析开放世界部署难题,展望未来“机器人模型即服务”。

海外独角兽