「自适应记忆建模」共找到 859 篇相关文章
不用额外缓存!英伟达开源大模型记忆压缩方案,128K上下文提速2.7倍
英伟达联合多机构推出TTT - E2E方法,在长文本处理上提速显著且性能不打折。它基于标准Transformer,将长文本建模转为「持续学习」任务,核心是上下文压缩,避免额外缓存,代码和论文已开源。
细节直逼亚毫米级!港科广分层建模突破3D人体生成|CVPR 2025
港科广团队提出MultiGO创新方案,借助分层建模思路突破3D人体生成难题。该方案通过三级几何学习框架提升重建质量,在多个测试集上性能领先,且在多领域有应用优势,研究成果入选CVPR 2025,项目代码将开源。
腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合
腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。
首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升
西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。
AI编程节省95% token,工具调用上限狂飙20倍,开源记忆系统登顶GitHub热榜
Claude - Mem是一款登顶GitHub热榜的持久化记忆系统,直击AI编程助手跨会话失忆痛点。它免费且省token,通过‘三层渐进式披露’架构,常规省90%,测试阶段省95%,工具调用上限提20倍。
腾讯混元 TurboS 技术报告首次全公开:560B 参数混合 Mamba 架构,自适应长短链融合
日前腾讯混元 TurboS 技术报告全公开。它是超大型 Hybrid Transformer - Mamba 架构 MoE 模型,有自适应长短思维链机制,总参 560B。在多榜单成绩亮眼,多语种和多任务处理能力强,还介绍了核心创新、训练策略等。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
大模型推理上限再突破:「自适应难易度蒸馏」超越R1蒸馏,长CoT语料质量飞升
本文从中兴通讯无线研究院「大模型深潜」团队切入,介绍了首创的「LLM自适应题目难度蒸馏」方法,该方法围绕「模型 - 数据动态匹配」提出了一条完整的CoT构建流程,显著提升了长CoT语料的质量。
中国19岁常青藤少年重塑AI记忆,斩获各大榜单全球第一,点亮AI联想科技树
M-Flow记忆引擎引发海外开发者社区热议,GitHub star破千,在三大公开benchmark评测中夺冠。它由19岁团队心流元素开发,采用Cone Graph分层结构,实现Graph RAG新范式,更注重联想,而非单纯搜索。
基础模型又一关键拼图,腾讯混元发布训练新范式「无相」:引入功能性记忆,打破静态权重枷锁
腾讯混元团队发布HY - WU范式,打破静态权重束缚,引入功能性记忆,实时生成个性化参数。应用于图形编辑基模效果好,在图像编辑任务表现优秀,还对未来AI架构提出多方面展望。