「多模态Agent」共找到 3456 篇相关文章
多模态卷王阶跃星辰Step 3登场,推理效率可达DeepSeek-R1 300%
新一代多模态推理基模Step 3登场,它采用原创MFA架构,具“多开好省”亮点,推理效率高、性价比优。7月31日将开源,能适配各芯片,还发起“模芯生态创新联盟”推动应用落地。
AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!
现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent多智能体系统,该系统多工具协作,实验中碾压GPT - 4,数据和代码将开源。
半天16.5k Star,谷歌AI Agent强势开源,AI编程变天了!
Google推出轻量级且功能强大的开源AI Agent——Gemini CLI,能将Gemini带入用户终端,可利用Gemini 2.5 Pro编写代码等,半天获16.5k Star,还具备多种强大功能。
OpenAI DevDay重磅新品曝光:Agent Builder来了!拖拽即可构建AI应用
OpenAI将在10月6日DevDay推出Agent Builder,用户能通过可视化画布拖拽构建AI智能体工作流,连接模型、工具等编排任务。其对手是n8n、Zapier,可集成第三方服务,降低AI应用开发门槛。
Agentic-KGR:通过多智能体强化学习实现知识图谱的协同演化
文章指出静态知识库有覆盖缺失、时效滞后、建用分离问题。介绍 Agentic - KGR 创新点,如动态 schema 扩展等。实验显示其在图谱抽取和下游 QA 任务有提升,还呈现训练动态和图谱质量可视化结果。
CVPR 2025 | 多模态统一学习新范式来了,数据、模型、代码全部开源
中国人民大学、清华和腾讯合作的CVPR 2025论文指出,当前多模态学习范式有缺陷。为此提出新范式,构建AV - UIE数据集、Crab框架,实现任务互助,在多任务上超垂类专家模型,数据、模型、代码开源。
关于多模态大模型Token压缩技术进展,看这一篇就够了
多模态大模型跨模态融合带来高计算成本,催生MLLM Token Compression研究。北大等机构人员基于压缩位置对方法系统归类,讨论特定场景压缩机制选择,还探讨了挑战与前景方向。
训练200万小时!OpenAI刚刚开源GPT-oss,AI Agent专属模型、可商用
今天凌晨OpenAI开源大模型GPT-oss,有1200亿和200亿两种参数,支持商用。它针对AI Agent训练,功能丰富。训练耗时超200万小时,测试表现出色,架构设计也有亮点。
首个GUI多模态大模型智能体可信评测框架+基准:MLA-Trust
MLA-Trust 是首个针对 GUI 环境下多模态大模型智能体的可信度评测框架,构建了涵盖四核心维度的评估体系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。
马斯克悄悄改了战场:Grok Build 0.2.60 剑指 Agent Runtime
2026年6月21日,Grok Build发布0.2.60版本更新,未推新模型能力,而是聚焦Runtime细节,针对会话难恢复、长任务易卡住、工具输出易污染上下文等痛点优化,让Agent更稳定可靠。