多模态记忆」共找到 1423 篇相关文章

开源动态8

500行极简开源框架,硬刚GPT/Gemini视觉极限!

多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI构建SWE-Vision框架,让模型用代码处理视觉判断,在五个视觉基准测试达最优,其极简设计有效且泛化性强,代码已开源。

新智元
开源动态8

想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下

阿里达摩院推出 RynnBrain 模型,从底层出发将时空记忆和物理空间推理训进模型,在 16 项具身 Benchmark 上达 SOTA。还开源 7 个模型,解决通用大模型在物理世界的局限,在多项任务表现出色。

机器之心
产品应用8

九天大模型大变身:性能狂飙35%!还能一键P大象

7月26日,中国移动在2025世界人工智能大会发布「九天」基础大模型3.0,端到端技术全面升级,复杂推理能力提升35%,智能体调用效率提升21%,还推出代码、数学等专项大模型,多模态能力也焕新。

新智元
新闻资讯7

Claude Opus 5被扒光了!1511行提示词底牌全摊开

Anthropic的Claude Opus 5上线当天,系统提示词被开发者Eversmile1传到GitHub。提示词含产品说明、法务合规手册、推销渠道内容。其记忆规则严格,版权引用限制多,商业推荐有不同策略。上线24小时能力被广泛测试。

新智元
开源动态8

狂揽4万星!换掉OpenClaw太爽了,5美元就能养个AI打工人

Hermes Agent是NousResearch推出的开源Agent神器,上线后在GitHub超4万星。它运行在用户服务器,有六大核心特性,能跨平台对话。技能自维护,形成记忆 - 技能 - 训练数据闭环,应用场景丰富,演进注重安全、稳定与智能。

新智元
推荐文章8

2025 年 InfoQ 趋势报告:AI、ML 和数据工程

InfoQ AI ML 趋势报告基于编辑团队与嘉宾播客,总结 AI、ML 技术发展趋势。涵盖 AI 代理、多模态语言模型等创新领域,也提及早期采用者、早期多数、晚期多数类别的技术,还对 2025 年相关领域发展作出预测。

InfoQ
新闻资讯7

4万多名作者挤破头,CVPR 2025官方揭秘三大爆款主题, 你卷对方向了吗?

CVPR 2025 官方根据 4 万多名作者 13008 份投稿,总结出计算机视觉热门的三大方向,即基于多视角与传感器的 3D 技术、图像与视频合成、多模态学习(视觉、语言和推理),并介绍了各方向热门原因。

机器之心
产品应用8

腾讯AngelSlim重磅升级!面向全模态的大模型压缩算法工具包,推理速度飙升 1.8倍!

近年来,推理阶段的成本等因素制约大模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。

腾讯技术工程
开源动态8

空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没

上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。

机器之心
算法论文8

大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

多模态大模型处理结构化图像有误差放大、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。

量子位