多模态统一」共找到 1269 篇相关文章

开源动态8

面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni

文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。

GitHubStore
产品应用8

别再“演智能”了,MiniMax Agent 才是真特工

2024 年有不少‘伪 Agent’项目,2025 年 AI Agent 开始在解决真实问题上落地。MiniMax Agent 在深度研究、网页生成、PPT 生成及多模态输入输出上超越竞品,其优势源于多方面,已从众多 Agent 产品中脱颖而出。

特工宇宙
算法论文8

高效智能体的「幕后推手」是谁?一篇综述带你从记忆×工具学习×规划看透

随着大模型能力提升,业界关注智能体落地,而高效性是决定能否上线的‘硬’问题。论文梳理‘高效智能体’综述,从记忆、工具学习、规划三机制出发,还谈及基准评测、挑战与展望。

机器之心
开源动态8

抖音SAIL团队联合港中文MMLab推出SAIL-Embedding:打通「视、文、音」的全模态嵌入

字节跳动抖音SAIL团队联合港中文MMLab提出SAIL - Embedding,专为大规模推荐场景设计,实现视、文、音统一表征,解决传统多模态模型局限,在抖音业务场景效果显著,相关技术报告已公开。

机器之心
新闻资讯7

刚刚,谷歌AI路线图曝光:竟要抛弃注意力机制?Transformer有致命缺陷!

谷歌未来AI路线图曝光,Gemini全模态是重点,模型向智能体转变,推理能力将扩展。谷歌还需突破现有注意力机制限制实现无限上下文。此外,文中盘点了OpenAI、DeepSeek等大厂AI年中表现。

新智元
开源动态8

上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下

上海人工智能实验室联合多家单位提出通用具身智能大脑框架VeBrain,能集成视觉感知、空间推理和机器人控制能力。它统一三类任务语言建模范式,有“机器人适配器”,配套VeBrain - 600k数据集,性能测试表现出色。

量子位
算法论文8

夜间感知新突破!北航等提出红外主导的高效目标检测方案 | ECCV'26

在复杂视觉场景中,传统RGB - IR多模态检测方法在低照度等场景下因RGB退化影响检测效果。北航等团队提出的InfraNet,以红外为主,用质量感知机制控制RGB引导,在多数据集取得强竞争力结果。

新智元
新闻资讯7

AI三国杀!OpenAI狂卷,DeepSeek封神,却被Mistral偷了家?

中美忙着堆算力打AI战,欧洲Mistral杀出,推出Large 3和Ministral 3,全开源、多模态、能落地。Large 3规格高,Ministral 3小而强,可跑在多设备上。Mistral还想成平台,挑战巨头。

新智元
产品应用8

字节Seedream 4.0将全量开放!抢先评测来了,我们摸索出AI生图20种「邪修」玩法

近日,字节跳动内测豆包・图像创作模型 Seedream 4.0,支持多模态生图,核心能力显著提升。它将全量上线并开放给企业客户。实测显示其多模态融合出色,还与谷歌 Nano Banana 对比,各有优势。

机器之心
开源动态7

惊讶!!!3.2 万 Star OpenViking,让你的原地起飞!!!

OpenViking有3.2万Star,它把记忆、文档、提示词等上下文统一成可浏览地址空间,设计三层信息按需加载,检索留轨迹,还接入多种工具。不过它处Alpha阶段,用前要考虑许可证。

小华同学ai