「轻量化机制」共找到 1188 篇相关文章
AgentScope 正式发布 Skills 支持 - 实现渐进式披露
文章指出大语言模型驱动的Agent系统存在核心矛盾,常见上下文加载方案有局限,缺乏灵活机制。介绍了AgentScope发布的Skill机制及渐进式披露策略,还讲了其在Java中的实现,最后分析了适用与不适用场景。
刚刚,Gemini 2.5系列模型更新,最新轻量版Flash-Lite竟能实时编写操作系统
谷歌更新Gemini 2.5系列模型,包括2.5 Pro和Flash稳定版及新推出的Flash-Lite预览版。谷歌CEO称Flash-Lite性价比高,适用于量大且注重成本的任务。报告还提及“智能体恐慌”现象。
LightX2V fp4 quant kernel代码笔记
这是关于 LightX2V 里 `lightx2v_kernel` 做 FP4 量化 GEMM 的读码笔记,解释接口和约束、kernel 关键路径等问题,还介绍 NVFP4 和 MX-Formats 量化原理、代码实现,以及 LightX2V 项目中的实际使用。
为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练
社区里长期存在的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且在多模型和硬件上验证有效。
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
当前大语言模型在长周期任务中,长时持久记忆管理陷入“精度不够”和“成本太高”的两难困境。中国人民大学团队提出MemSifter框架,将记忆检索工作外包给轻量级代理模型,在8个权威测试中超越现有方案,且已开源。
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。
AI 本地跑?Google 新开源模型上线,本地量化后占用不到 200MB 内存,支持百余语言
Google DeepMind推出开源嵌入模型EmbeddingGemma,专为本地设备高效运行设计。它用Matryoshka方法和量化感知训练,提升效率。在MTEB测试中成绩佳,支持百余种语言,内存占用少,已集成多种工具。
Agent 自我改进的六条路
文章梳理了让 AI Agent 不重新训练就能变强的六种机制,包括输出自审、持久记忆、进化搜索、对抗训练、自我修改和编排自优化,介绍了各机制代表项目及成果,指出 AI 学习正从训练溢出到部署阶段。
ICCV 2025 | 清华&腾讯混元X发现「视觉头」机制:仅5%注意力头负责多模态视觉理解
本文聚焦多模态大模型,提出基于 OCR 任务量化注意力头视觉偏好的方法,发现仅不到 5%“视觉头”主导视觉理解。还提出 SparseMM 策略优化 KV - Cache 资源分配,经多基准评测,性能和效率表现优。
GitHub 2.5万星!日本开发者打造的Hono火了:定义后React时代微框架的轻量未来
本周,Web 框架 Hono 在 X 官宣,GitHub 获 25000 星标。它由日本开发者 Yusuke Wada 于 2021 年创建,基于 Web 标准,可在多运行时运行,或指明后 React 时代 Web 框架方向。