「内存压缩」共找到 396 篇相关文章
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
AI编程Token消耗降低神器:RTK(Rust Token Killer)实战指南
文章介绍RTK(Rust Token Killer),它能在CLI命令输出到LLM上下文前智能过滤压缩,节省60 - 90%Token。文中说明了其原理、特性、压缩策略,还给出安装配置步骤、实测数据及使用建议。
清华校友出手,8B硬刚GPT-4o!单一模型无限工具调用,终结多智能体
MIT等机构推出TIM和TIMRUN组合拳,突破模型token天花板。TIM将推理建模为任务树,TIMRUN优化内存管理。二者结合支持长程推理,实现单模型高效推理,简化智能体构建,在多方面表现出色。
TACO: 让 CLI Agent 在自主迭代中学会丢掉无用上下文
由多校及研究团队联合提出 TACO,这是无需训练、即插即用的终端智能体自进化观测压缩框架。它能让智能体学习压缩规则,过滤低价值输出,保留关键线索,实验显示其提升了任务成功率和 token 效率。
关于内存价格转跌,我们和贸易商聊了聊
3月30日,服务器内存贸易商称内存价格从前几天开始跌,30日跌得最凶。国内DDR4价格跌幅超30%,DDR3价格腰斩,DDR5较坚挺。谷歌新算法引发市场震动,从业者认为DDR4暴跌还有其他原因。
苹果提出新型反向传播:一台iPhone 15 Pro Max就能微调LLM
苹果提出内存高效型反向传播(MeBP),可在内存使用量和计算时间上比零阶优化(ZO)有更好权衡,收敛更快、性能更优,还在iPhone 15 Pro Max验证其有效性,且公开了实现链接但目前为空。
万字长文!大模型LLM推理优化技术总结
文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。
SK 海力士,市值突破4000亿美元
1月27日,SK海力士股价创新高,市值达4031亿美元,三年涨10倍。因AI基建投资扩张,内存芯片供应紧缺。传其为微软供芯,韩媒称它和三星提高LPDDR内存价,或影响iPhone 18价,还将发高额奖金。
内存涨价,千元机的天塌了
去年下半年起存储芯片涨价,因AI基础设施需求爆发,三大存储芯片厂产能被榨干。消费级产品供应受挤压,中低端手机成最大受害者,各厂商搁置低价产品线,中低端市场持续萎缩。
压缩之外,Visual Tokenizer 也要理解世界?
MiniMax和华中科技大学发布视觉tokenizer新研究VTP,引发业界热议。该研究揭示传统仅以重建为目标的视觉tokenizer缺乏高层语义表示,提出在预训练中引入语义理解,还发现Scaling Law现象,虽有争议但为研究提供新视角。