显存压缩」共找到 286 篇相关文章

开源动态8

专为“超大模型而生”,新一代训练引擎 XTuner V1 开源!

9月8日,上海AI实验室开源书生大模型新一代训练引擎XTuner V1。它能应对复杂训练场景、速度更快,尤其在超大规模稀疏混合专家(MoE)模型训练中优势显著。还将一并开源AIOps工具DeepTrace与ClusterX。

OpenMMLab
算法论文8

训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式

大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。

深度学习自然语言处理
推荐文章7

上下文工程如何重塑智能体的“思考方式”?

文章指出在大模型时代,智能体能否理解上下文是关键。介绍了上下文工程的魔力、从提示词到上下文工程的演进,分析了上下文工程不等同于上下文的原因及常见失败类型,还给出编排设计和常见策略,最后提及用RAGFlow构建私有知识问答应用。

阿里云开发者
7

英伟达GPU被曝严重漏洞,致模型准确率暴跌99.9%

英伟达GPU被白帽黑客发现严重漏洞,通过GPUHammer攻击可使大模型准确率从80%降至0.02%。此攻击属Rowhammer类,直接对显存“物理动手”。英伟达建议的防御措施会使模型性能下降。

量子位
算法论文7

大模型也需要睡觉!让AI打个盹,醒来更聪明

卡内基梅隆大学和马里兰大学研究发现,大模型处理长上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进长期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。

量子位
开源动态8

消费级显卡可以快速上手跑!面壁智能MiniCPM-o 4.5发技术报告

面壁智能联合多方发布MiniCPM-o 4.5技术报告。该模型是业界首个端到端全双工全模态大模型,参数约9B,依托Omni - Flow框架,多项性能对标前沿大模型,还推出多种使用方式,兼顾普通用户与开发者需求。

量子位
产品应用7

给 AI 戴上六顶思考帽

作者探讨如何让 AI 长时间高质量输出,提出初版方案。后借助「六顶思考帽」思维法,用 Moxt 产品创建 6 个 AI 同事评审草稿,各帽给出反馈,AI 间通过文件协作,Moxt 有小问题但方向值得关注。

AGI Hunt
开源动态8

深度解析 OpenClaw 在 Prompt / Context / Harness 三个维度中的设计哲学与实践

文章从Prompt、Context和Harness三个维度解析OpenClaw设计思路。Prompt工程有动态组装与文件驱动特点;Context工程含可扩展技能、上下文压缩修剪及双层记忆管理;Harness工程为模型套“马具”,保障其可控运行。

阿里云开发者
算法论文8

以「图」破局,HyperOffload定义超节点存储管理新范式

随着生成式AI进入万亿参数时代,大语言模型面临“显存墙”挑战。上海交大与华为MindSpore团队发布技术报告《HyperOffload》,其核心技术集成于MindSpore 2.8,能提升超节点异构资源协同效率,已在多项目落地。

机器之心
算法论文8

模型大一统?1100多个模型殊途同归,指向一个「通用子空间」!

约翰斯・霍普金斯大学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间。此研究为神经网络参数空间“通用性”提供严谨实证,虽成因待探索,但意义深远。

AINLPer