大模型记忆」共找到 9349 篇相关文章

算法论文8

清华唐杰团队揭示大模型记忆全景

清华唐杰教授团队等发布大模型记忆架构综述,提出三维记忆分类学,将前沿工作统一到理论框架,为LLM设计指明方向,分析了隐式、显式记忆架构,还探讨混合架构挑战与未来方向。

量子位
新闻资讯8

大模型记忆系统 MemOS 2.0:StarDust 技术演进与关键挑战|QCon 北京

4月16 - 18日QCon北京会聚焦Agentic AI等前沿话题,记忆张量CTO李志宇将分享《大模型记忆系统MemOS 2.0:StarDust技术演进与关键挑战》,梳理技术演进,推出MemOS 2.0 StarDust,还分析实践痛点与演讲亮点。

InfoQ
开源动态8

告别模型“失忆”!人开源MemSifter:轻量代理先思考再回忆,搞定长时记忆

当前语言模型在长周期任务中,长时持久记忆管理陷入“精度不够”和“成本太高”的两难困境。中国人民学团队提出MemSifter框架,将记忆检索工作外包给轻量级代理模型,在8个权威测试中超越现有方案,且已开源。

PaperAgent
新闻资讯7

腾讯混元挖走微软明星模型团队!一作全员出走,新成果已跻身模型竞技场TOP 10

微软明星模型WizardLM一作全员加入腾讯混元,最新成果Hunyuan - Turbos跻身模型竞技场TOP 10。此前WizardLM - 2发布不顺,且微软将裁员超6000人,国内厂正激烈争夺模型人才。

量子位
新闻资讯8

王小川:医疗行业对模型有三刚性要求,但通用模型一条都不达标

5月22日百川智能展示医疗模型Baichuan - M4与AI家庭医生「百小医」。王小川指出通用模型用于医疗有问题,医疗对模型有低幻觉、强循证、会提问的刚性要求,而通用模型不达标。Baichuan - M4表现出色,百小医也有独特定位和优势,且与三家顶尖医院合作成果显著。

Founder Park
算法论文8

高瓴-华为诺亚:语言模型智能体记忆机制的系列研究

中国人民学高瓴人工智能学院与华为诺亚方舟实验室聚焦语言模型智能体记忆能力,形成含综述论文、数据集和工具包的研究体系。探讨记忆概念、重要性、实现与评测方法,还构建评测榜单、实现工具包。

机器之心
算法论文8

定位模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆

此前学术界发现模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。

量子位
推荐文章7

模型 Token 究竟是啥:图解模型Token

文章详细解释模型Token概念,指出分词器会把文字切成Token,不同分词器切分结果不同。还介绍分词器的分词方法,通过统计文字出现频率打包成Token并编号,不同模型切分结果有差异。

机器学习AI算法工程
算法论文7

多模态模型理解物理工具吗?PhysToolBench提出了衡量多模态模型对物理工具理解的基准

香港科技学等团队提出 PhysToolBench,用于衡量多模态模型对物理工具的理解。它将理解分为三个等级,测试 32 个模型,揭示了模型在工具理解上的不足,也为未来发展指明方向。

机器之心
产品应用7

钉钉上跑出的第一个行业专属模型落地:准确率超 90% 的妇科专业模型

近日,壹生检康在钉钉企业专属 AI 平台训练出“豆蔻妇科模型”,准确率达 90.2%。钉钉构建支持体系助企业构建模型,后续还将帮伙伴构建模型和智能体,服务中小企业。

AI前线