「四层记忆架构」共找到 2286 篇相关文章
统一架构新思考,北大团队UniWorld-V1统一大模型
北大袁粒课题组提出统一大模型架构UniWorld-V1。通过对GPT - 4o - Image实验,发现其依赖语义编码器提取视觉特征,据此设计架构,在多基准测试表现优异,开源代码等促进研究。
DeepSeek、GPT、Qwen,所有大模型架构图都有,Karpathy:宝藏画廊!
大模型赛道热闹,架构创新多,理解困难且缺清晰架构图。AI 研究者 Sebastian Raschka 绘制主流大模型结构,整理成在线图谱「LLM Architecture Gallery」,方便研究者查阅对比。
让 Coding Agent 开始「记住过去」:MemoraX Code 的长期记忆系统
过去一年,Coding Agent 改变开发者写代码方式,但进入长期开发仍会遗忘项目经验。MemoraX Code 试图解决此问题,构建了本地与云端记忆,让关键信息能被识别召回,且在赛事中表现出色,还能沉淀工程经验。
当模型成为公共基础设施,特赞如何架构企业级 Agentic AI?
当大模型成公共基础设施,企业需构建围绕业务结构的智能系统架构。特赞提出的 GEA 企业级智能体架构体系,围绕企业业务运行结构设计,能让智能体参与企业经营判断。
架构解耦是统一多模态模型所必须的吗?全新AIA损失:No
香港中文大学 MMLab 和美团研究者思考架构解耦是否为统一多模态模型必须,推出 AIA 损失。研究发现架构解耦未解决任务冲突,AIA 能提升模型性能,减少数据配比问题。
极客大神构建了LLM架构画廊,AI大神Karpathy点赞
极客大神Sebastian Raschka构建LLM Architecture Gallery,将复杂模型结构化繁为简,引发技术圈讨论,AI大神Karpathy点赞。画廊高度视觉化、互动性强,展示模型架构图及核心参数,源数据开源。
刚刚,Claude实现「永久记忆」!官方还没上线,大神已玩疯
昨天Claude被曝要有永久记忆,今天开发者就用Smart Forking扩展让其拥有「可继承的长期记忆」。实测成功率100%,与官方知识库理念不同,Claude Code也破圈引发轰动。
Transformer上限触顶,Mobius能否引发下一代模型架构的革命?
自ChatGPT问世,Transformer上限备受关注。前OpenAI、Google负责人称其走到尽头。国内改进架构受算力限制。上海人工智能实验室的书生Mobius团队提出分离知识与推理的架构,有望解决商用等关键问题。
都说记忆是Agent标配,但MemSyco发现漏算了一件事
厦门大学与吉林大学的最新研究指出,随着大模型Agent具备长期记忆,虽成为“长期协作者”,但也出现Memory-Induced Sycophancy问题。为此提出MemSyco - Bench评测基准,经实验得出多项发现,指出Agent Memory关键瓶颈转变。
刚刚,DeepSeek 突发梁文峰署名新论文:V4 新架构提前曝光?
今天凌晨,DeepSeek在其GitHub官方仓库开源了新论文与模块Engram。该论文提出“查—算分离”机制,通过引入可扩展的查找记忆结构,在等参数、等算力条件下提升模型表现,代码与论文全文均已开源。