多模态记忆」共找到 1427 篇相关文章

开源动态8

一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一

文档OCR正迈入小模型时代,MonkeyOCRv2以0.7B、0.6B参数在MDPBench上超越3B模型。它重新分配系统职责,采用互补预训练目标,还开源训练数据,且迁移到多任务表现良好。

量子位
产品应用8

比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线

大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。

机器之心
开源动态8

GPT-Image-2平替!最强开源生图模型来了

OpenAI推出GPT Image 2引发AI生图大战,国内厂商商汤反击,推出多模态理解生成模型SenseNova U1并全面开源。它通过自研架构实现理解、推理、生成统一,实测表现惊艳,能力全维度,与GPT-Image-2范式不同。

新智元
产品应用7

GPT5.5 + Codex 如何跑一整夜,编程的下一步,不是辅助编程,是可托管执行单元

文章指出GPT - 5.5在Codex里展现出强大自主性,能处理长时程任务。还介绍让其跑长任务的方法及面临的问题,强调长任务需状态机、证据链等,社区也在构建相关工作流层。

AI进修生
产品应用7

谷歌向左、李飞飞往右,阿里世界模型「快乐生蚝」杀出第三条路

阿里推出世界模型HappyOyster(快乐生蚝),基于原生多模态架构,有漫游和导演两大核心功能,可实时构建和交互。与文生视频模型不同,它能随时被干预。虽世界模型尚处早期,但应用场景广泛。

机器之心
产品应用7

Claude Opus 4.7来了,公开模型里的SOTA!不过用起来GPT味好浓

Anthropic推出Claude Opus 4.7,虽有像GPT的争议,但在多方面表现出色。它在高级软件工程、视觉能力等四大方向升级,且具备防护措施和记忆增强。全平台开放,与Opus 4.6同价,使用有注意事项。

量子位
开源动态8

腾讯混元开源世界模型!2.0版本一键生成3D空间,游戏关卡随心造

4月16日,腾讯正式发布并开源混元3D世界模型2.0(HY - World 2.0)。它是多模态模型,能理解多种输入,自动生成、重建和模拟3D世界,支持多格式3D资产导出,可与游戏工作流对接。

量子位
产品应用8

全球第一,13个SOTA!我们找到了龙虾界掌管GUI的神

明略科技推出自研 GUI-VLA 智能体模型 Mano-P 1.0,不依赖 API 对接与浏览器场景,可操作桌面软件与网页界面。它在 13 个多模态基准榜单达 SOTA,支持本地运行,数据零上云,采用分阶段开源策略。

机器之心
新闻资讯8

从Token到词元:全模态时代的基模与交互入口

2026年3月24日国家数据局确立“词元”为Token标准译名,Token生成与消耗方式在多模态场景正发生变化。模思智能获数亿融资,探索从语音到全模态的路径,成果颇丰且完成能力闭环,其发展受关注。

量子位
算法论文8

Agent搜索哪家强?人大高瓴&快手联合发布全新评测基准GISA

人大高瓴与快手联合发布全新评测基准GISA,用于评估智能体搜索能力。它解决了现有基准反向构造、评估维度单一、答案易被记忆等问题,含373个高质量查询,实验显示当前搜索智能体距人类水平差距大。

PaperAgent