原生多模态架构」共找到 2923 篇相关文章

推荐文章8

2025 年 InfoQ 趋势报告:AI、ML 和数据工程

InfoQ AI ML 趋势报告基于编辑团队与嘉宾播客,总结 AI、ML 技术发展趋势。涵盖 AI 代理、多模态语言模型等创新领域,也提及早期采用者、早期多数、晚期多数类别的技术,还对 2025 年相关领域发展作出预测。

InfoQ
新闻资讯7

4万多名作者挤破头,CVPR 2025官方揭秘三大爆款主题, 你卷对方向了吗?

CVPR 2025 官方根据 4 万多名作者 13008 份投稿,总结出计算机视觉热门的三大方向,即基于多视角与传感器的 3D 技术、图像与视频合成、多模态学习(视觉、语言和推理),并介绍了各方向热门原因。

机器之心
新闻资讯8

《2026 OpenClaw 类自主智能体发展白皮书》正式发布 | 中科算网算泥社区

5月20日,中科算网算泥社区发布《2026 OpenClaw类自主智能体发展白皮书》,阐述从“对话式AI”到“代理式AI”的转变。介绍OpenClaw类自主智能体定义、技术剖面、关键能力及系统架构,为从业者提供参考。

AIGC开放社区
推荐文章7

业务逻辑的“坍塌”:当应用层只剩下胶水代码,在 AI Agent 时代,我们该构建什么

作者梳理从“怀疑AI”到“理解并驾驭AI”的心路,探讨LLM不确定性、AI开发概念,手搓Agent示例介绍开发关键点,分析LangChain价值,思考混合架构,还从性能视角看LLM,回顾其关键跃迁。

阿里云开发者
推荐文章8

英伟达GPU全系列硬核科普手册:一文读懂NVIDIA芯片的定位、规格与应用场景

这是英伟达GPU全系列硬核科普手册,覆盖消费级、工作站、推理卡、训练卡及中国特供版五大产品线,讲清区别与用法,还介绍架构演进、命名规则等,助读者秒变选型高手。

腾讯技术工程
产品应用8

海外华人15人团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑

海外AI初创公司Luma发布图像生成模型Uni-1,将「理解」与「生成」统一,在多任务测试中表现优于GPT Image 1.5和Google Nano Banana Pro。它采用独特架构,提升理解能力,由华人团队打造。

机器之心
产品应用8

我把Agent拉进群聊,它竟然开始带队干活?全球首个AI社交通用平台来了!

全球首个AI社交通用平台「Teamily AI」上线,AI Agent可参与社交互动。它不挑内容形态,能进群协作,还能零部署构建专属OpenClaw。其有三层架构,团队实力强,或改变人类协作方式。

量子位
产品应用8

腾讯AngelSlim重磅升级!面向全模态的大模型压缩算法工具包,推理速度飙升 1.8倍!

近年来,推理阶段的成本等因素制约大模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。

腾讯技术工程
开源动态8

空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没

上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。

机器之心
算法论文8

大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

多模态大模型处理结构化图像有误差放大、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。

量子位