多模态Agent」共找到 3473 篇相关文章

算法论文8

最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代

人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。

机器之心
产品应用8

奥特曼重磅发声:全AI公司是未来!OpenAI官宣Frontier,让管理Agent像管人一样简单

OpenAI推出智能体中枢平台Frontier,可整合企业系统与数据,让智能体稳定运行。目前Anthropic在企业级大模型市场份额领先,OpenAI想借Frontier卡位。该平台已获多家巨头试用,有望拉开AI扎根企业核心业务时代序幕。

InfoQ
新闻资讯7

2026“企业 Agent 上岗元年”?零一万物六大判断定义企业多智能体,不再沿用大厂标准化产品模式”

1月5日,零一万物发布《中国企业智能体2026六大预判》,展示“万智2.5企业多智能体”。基于实践总结六大核心预判,还升级万智平台,不沿用大厂标准化模式,规划企业多智能体进化“三步走”布局。

AI前线
开源动态8

告别“音画割裂”与“人物崩坏”!AutoMV:首个听懂歌词、卡准节拍的开源全曲级MV生成Agent

现有AI视频生成模型做全曲MV有时长限制、音画割裂和一致性差等问题。AutoMV作为开源多智能体系统,模拟人类影视制作流程,能生成长达数分钟、叙事连贯且音画同步的完整MV。

量子位
算法论文8

牛津VGG、港大、上交发布ELIP:超越CLIP等,多模态图片检索的增强视觉语言大模型预训练

牛津VGG、港大、上交大团队论文提出ELIP方法,用学术界资源增强视觉语言大模型预训练,用于文字 - 图片检索。该论文被大会接受并获最佳论文提名。ELIP可应用于多个大模型,实验显示能显著提升图片检索表现。

机器之心
开源动态8

多模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解多模态复杂推理难题

上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI长链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。

量子位
新闻资讯7

微软 CEO Satya:“传统的软件应用层正在瓦解,将逐渐被AI智能体(Agent)所取代”

微软CEO Satya Nadella称传统软件应用层正瓦解,将被AI智能体取代。微软布局‘AI智能体层’,让Microsoft 365成集成开发环境。他还号召SaaS企业成为数据源,专注数据API建设。

宝玉AI
7

做AI漫剧的、搞Agent的、投硅谷的,5.20这些赛道顶流碰头了|最新嘉宾阵容

5月20日,量子位将在北京举办中国AIGC产业峰会,主题为「@所有人,马上AI起来」。峰会聚齐百度、智谱等企业实战派,还将揭晓2026年度AIGC企业&产品榜单,发布《2026年中国AI应用全景图谱报告》。

量子位
算法论文8

让大模型多模态检索全面超越SOTA!ReCALL框架化解生成式与判别式的范式冲突|CVPR'26

紫东太初团队联合新加坡国立大学攻克大模型检索难题,其ReCALL框架以‘诊断 - 生成 - 校准’闭环体系解决范式冲突,让大模型变身高效检索器,成果被CVPR 2026录用,刷新SOTA性能。

量子位
开源动态7

Python只是前戏,JVM才是正餐!Eclipse开源新方案,在K8s上不换栈搞定Agent

近期,Eclipse 基金会在开源平台 Eclipse LMOS 推出‘代理定义语言’(ADL)。LMOS 项目旨在用统一、开放方式重构企业级 AI 代理开发与运维链路,对标专有平台与 Python 技术栈,避免企业‘推倒重来’。

InfoQ