「多模态参考」共找到 1092 篇相关文章
首次!世界模型、动作模型融合,全自回归模型WorldVLA来了
阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。
绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%
JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。
登上热搜!Prompt不再是AI重点,新热点是Context Engineering
最近「上下文工程」很火,Andrej Karpathy 为其打 Call。它和「提示词工程」不同,是构建自动化系统给模型提供输入。文章介绍了其核心要素、实践方法论,还给出了参考的博客和视频。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!
4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。
面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni
文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。
一个APP就能拍短片!人物、字幕、BGM……AI Agent统统自己搞定
剪映旗下内容创作Agent小云雀上线新功能,可文生数字人,还能根据提示词生成视频。它有“参考图生视频”玩法,能解决图片混剪难题。依托字节模型,创作门槛低,交付质量高,限时免费。
别再“演智能”了,MiniMax Agent 才是真特工
2024 年有不少‘伪 Agent’项目,2025 年 AI Agent 开始在解决真实问题上落地。MiniMax Agent 在深度研究、网页生成、PPT 生成及多模态输入输出上超越竞品,其优势源于多方面,已从众多 Agent 产品中脱颖而出。
夜间感知新突破!北航等提出红外主导的高效目标检测方案 | ECCV'26
在复杂视觉场景中,传统RGB - IR多模态检测方法在低照度等场景下因RGB退化影响检测效果。北航等团队提出的InfraNet,以红外为主,用质量感知机制控制RGB引导,在多数据集取得强竞争力结果。
OpenAI 详解规模化低延迟语音 AI 的 WebRTC 架构
OpenAI 介绍为全球规模低延迟语音 AI 调整 WebRTC 架构,将传统媒体终结模型换为中继收发器架构,分离职责,避免复杂逻辑堆砌与转嫁。此架构为实时语音技术布局补充基础设施细节,对架构师有参考价值。