「大记忆模型」共找到 9398 篇相关文章
开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4
上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用多阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。
现有AI都是假实时!Thinking Machines发布交互模型,离真正的贾维斯真的近了
Thinking Machines发布交互模型,切入与AI交互方式问题。该模型能原生支持实时交互,由交互和后台模型组成。架构设计独特,解锁多项功能,评测表现佳,但也存在长会话、计算部署等局限。
深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来
本文深入解读“世界模型”,虽无明确定义,但从目的出发分为表征和生成两类。前者含生物大脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。
让Agents更聪明,3招搞定记忆管理~
文章深度分析开源项目Memori,探讨Agent记忆管理。它将记忆分短期和长期,通过三个Agent协同工作实现长短期记忆功能,使记忆成结构化知识库,且能无缝衔接多种API。
英伟达韩松团队新作:具有后神经架构搜索的高效语言模型
英伟达韩松团队推出基于后神经架构搜索的高效语言模型Jet - Nemotron,在基准测试中表现出色,准确率与Qwen3等相当甚至更优,生成吞吐量大幅加速。模型构建经多步骤优化,代码和预训练模型将开源。
OpenAI突然开源新模型!99.9%的权重是0,新稀疏性方法代替MoE
OpenAI悄悄开源新模型,0.4B参数且99.9%权重为零,是Circuit Sparsity技术的开源实现。该技术通过约束模型内部连接稀疏性,解决传统稠密Transformer黑箱问题,或让MoE模型走上末路,但目前算力成本极高。
Agents统一综述:Harness、记忆、Skills和协议
上交大、中山大学等发表长文对LLM Agents中的记忆、Skills、协议与Harness工程进行统一综述。介绍了从权重到上下文再到Harness能力的三次迁移,阐述记忆、技能、协议系统及Harness工程,还分析了模块间耦合。
陶大程技术博客首发:从像素复刻到行动控制,具身世界模型的底层逻辑探索|甲子光年
今年世界模型成AI热点,通用世界模型追求像素逼真,具身世界模型不同,其使命是支撑行动。文章拆解具身世界模型底层逻辑,分享开悟世界模型的技术设计与实践思考。
Meta 删邮件事故背后,OpenClaw 为什么会“失忆”?代码库维护者拆解记忆架构
文章围绕 OpenClaw“失忆”问题展开,由代码库维护者拆解其记忆架构。通过 Meta 删邮件事故引出代理记忆问题,分析记忆四层结构、三种失败模式,给出应对建议,还介绍检索工具、配置及故障排除方法。
深度讨论新一轮模型发布:当智能进入月更时代 | Best Ideas
近期全球模型迎来高密度发布期,Anthropic、OpenAI、腾讯、DeepSeek 等纷纷推出新模型。文章复盘了 Opus 4.7、GPT - 5.5、DeepSeek V4 等模型实测体验,探讨架构变化、能力边界与产业影响,还分析算力、token 价格等问题。