「多模态大模型智能体」共找到 9571 篇相关文章
国产王炸!上海AI Lab开源Lumina-DiMOO,开创多模态理解与生成新范式
上海人工智能实验室等多机构推出多模态生成与理解统一模型Lumina - DiMOO,采用全离散扩散架构。它解决传统多模态架构问题,有全离散扩散建模等四大创新,性能在多基准测试中领先,应用前景广。
玩转智能体协议:谷歌开发指南教你拼出工业级AI应用
谷歌两篇开发指南拆解六大前沿开放协议核心代码,从开发者挑战赛提炼五条架构法则。介绍各协议用途,如MCP消除重复劳动,A2A规范智能体通信等,阐述协议协同运作及架构法则助力工业级智能体应用开发。
腾讯的这款AI数据智能体工具Lumos,颠覆了传统的数据分析
文章聚焦腾讯AI数据智能体工具Lumos,它是Tomoro的数据智能体,采用多智能体架构解决复杂问题。文中介绍其技术思路、实践方案,如解决多智能体一致性、提升查询响应等,还提及后续优化方向。
跨越智能体落地的可信鸿沟:玄甲(AgentWard)全链路防御操作系统正式发布
大模型向自主智能体演进,安全威胁全域化。当前安全方案有局限,制约产业落地。清华大学团队推出玄甲全链路安全防御操作系统,构建五层纵深防御体系,已落地应用,降低安全事件发生率,筑牢安全防线。
可能是目前效果最好的开源生图模型,混元生图3.0来了
腾讯混元发布并开源原生多模态生图模型混元图像3.0,参数规模80B,是参数量最大的开源生图模型,也是首个开源工业级原生多模态生图模型,效果对标业界头部闭源模型。文中介绍其技术方案、测评效果等。
大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力
空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。
小扎不死心Manus“自研”了一个,但模型用的Claude……
Meta推出智能体平台Hatch,功能类似Manus,开发阶段用Claude,计划正式上线时切换到自研模型Muse Spark,10月推出新模型Watermelon。Hatch注重消费数字生活,与Meta社交生态深度绑定,高端订阅有默认分发优势,但面临真实环境考验。
NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理
面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。
昇腾910B大模型实测:开源框架能不能打?真相全放这了
文章对昇腾 910B 大模型进行实测,对比 vLLM Ascend 与 MindIE 在实际推理场景中的性能差异。通过 GPUStack 平台测试多种模型,结果显示两者在不同部署场景各有优势,vLLM 适合单卡小模型,MindIE 适合大模型多卡部署。
英伟达开源上瘾了!推出了一款实时语音智能体的终极 ASR:24ms 极速锁定。
英伟达开源了Nemotron Speech ASR模型,它是低延迟、实时流式语音识别模型,单句转录锁定仅需24毫秒。其核心能力包括缓存感知、运行效率高、动态运行灵活,还被放进完整语音智能体方案。