算法论文8
DeepSeek:大模型75%思考+25%记忆最优
花叔
AI 摘要
DeepSeek论文指出,现有大模型用计算模拟查字典浪费算力。其提出Engram模块给模型装“记忆”,实验发现参数约75-80%用于思考、20-25%用于记忆效果最佳,还显著提升推理和长文处理能力。
阅读原文 · 花叔
【梁文锋署名】DeepSeek再发新论文:75%思考+25%记忆,这是他们算出来的最优解
DeepSeek新论文《Conditional Memory via Scalable Lookup》提出Engram模块,指出大模型用计算模拟查字典是浪费算力,Engram能给模型装“记忆”,还发现参数分配呈U型缩放定律,推理和长上下文能力提升显著。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
TAAC×KDD大赛落幕,600万奖池有归属
TAAC × KDD Cup 2026大赛落幕,600万奖池揭晓归属。大赛吸引52国13913名选手,竞争激烈。冠军团队分别用DeepSeek网页版等工具,在赛题“统一建模”难题上各展方案,其成果或助广告外的LLM研究。
机器之心
新闻资讯7
DeepSeek涨价,马斯克订阅成性价比之王
DeepSeek官发涨价第三天,峰谷定价且整体涨幅大,实际体感比价格表夸张,Opencode go也涨价降额度。而马斯克的Supergrok heavy成全球性价比之王,买它送Cursor ultra,还附赠多项权益。
探索AGI
开源动态8
DeepSeek 5个开源项目超火!
几天前,DeepSeek发布开源智能体框架`DeepSeek Harness`,热度极高。围绕它社区长出丰富高星项目,本文整理了5个,如核心项目`DeepSeek Harness`、桌面客户端、Web UI插件、终端交互插件及插件导航手册。
开源先锋
新闻资讯7
DeepSeek涨价,OpenAI降价,Agent改写价格战
近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。
DeepTech深科技