通用多模态推理」共找到 3287 篇相关文章

算法论文8

华为诺亚发布ScaleNet:模型放大通用新范式

华为诺亚方舟实验室等团队提出 ScaleNet 方法,创新性地用少量额外参数量将模型深度扩展一倍。结合层级权重共享和轻量级适配器技术,在视觉和语言任务上验证了有效性,提升了模型性能。

机器之心
算法论文8

MoCa:首个大规模双向多模态表征模型

为解决VLM用于嵌入的痛点,中国人民大学等机构研究者提出MoCa框架,可将单向注意力VLM训练成双向多模态编码器。它分两阶段,实验效果好,未来可拓展模态、提升多语言适应等。

PaperAgent
开源动态8

斯坦福开源复杂推理AI Agent,融合超10种工具

传统AI助手应对复杂任务能力有限,斯坦福开源OctoTools,这一复杂推理AI Agent融合11种工具。它在16项基准测试中准确率高,能应对多领域复杂场景,框架含工具卡片、规划器等构件。

AIGC开放社区
推荐文章8

从检测到通用感知:构建空间智能的基础

本文整理自张磊在AICon 2025北京的分享,分析语言与视觉原生模型架构区别,介绍基于Transformer的物体检测算法及开集检测技术进展,如Grounding DINO和DINO - X,还探讨其在多领域的应用和潜力。

InfoQ
开源动态8

让本地大模型不再重复推理的缓存技巧

本地跑大模型时,同样问题换说法问,模型又要重新推理。`constraint-cache`这个Python库可解决此问题,它将语义相似查询规范化为统一缓存键,实现近乎即时的重复查询响应,还避免了随机性响应问题。

AI工程化
新闻资讯8

AI Spot 学术分享会丨ICLR 2026 深度推理专场

当大模型走向深度推理,ICLR 2026 汇聚全球顶尖成果。OpenMMLab 等联合发起 AI Spot ICLR 2026 学术分享会,5 月 14 日 19 点直播,聚焦模型‘慢思考’,嘉宾将解读四大核心技术。

OpenMMLab
新闻资讯8

Google重磅上线通用世界模型Genie 3 - 此即未来。

Google发布世界模型Genie 3,它与Sora等AI视频产品本质不同,像可实时演算的模拟器。Genie 3解决了前辈无法调和的矛盾,在交互、时长、控制等方面有突破,虽有局限,但打开新世界大门。

数字生命卡兹克
开源动态8

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元
新闻资讯7

冲击自回归,扩散模型正在改写下一代通用模型范式

Google I/O 2025 开发者大会上,Gemini Diffusion 引发关注,它是采用扩散模型的语言模型。此前已有团队探索扩散式 LLM,如斯坦福、上海 AI 实验室等。蚂蚁集团和人大推出 LLaDA,后发展出多模态模型,国内团队跻身前列。

机器之心
推荐文章8

麻省理工大学:《通往通用人工智能之路》的研究报告

麻省理工科技评论洞察与Arm公司合作发布《通往通用人工智能之路》报告,探讨AGI定义、实现时间表、当前AI局限性及技术路径等。指出当前AI有局限,实现AGI需解决诸多障碍,还强调计算能力和异构计算的重要性。

力学与人工智能