轻量化」共找到 341 篇相关文章

开源动态8

最新W4A4KV4全量化框架,单卡A100大模型推理速度飙升

计算所王颖研究员团队等联合在ASPLOS 2025上发表并开源COMET框架,通过系统 - 算法协同优化,实现全4比特推理性能突破,在多方面有技术亮点,实测性能碾压现有方案且已开源。

AIGC开放社区
开源动态8

警报拉满,10k star , QuantDinger,赚钱可能就是这么简单!!!!

量化交易常存在研究、策略、回测和实盘间“失忆”问题。QuantDinger将量化流程形成闭环,是Open - source AI Trading OS,有研究、策略管理等四大核心能力,介绍了使用方法、适用人群。

小华同学ai
新闻资讯7

16岁炒马斯克鱿鱼,SpaceX天才转投北大数学校友赵鹏麾下

16岁天才Kairan Quazi从SpaceX离职,入职全球顶尖量化交易公司Citadel Securities。他曾14岁毕业于圣克拉拉大学,被马斯克选中加入SpaceX。他表示量化金融反馈快、结果直观,且新公司欣赏他的非传统背景。

量子位
开源动态8

首个完整开源的生成式推荐框架MiniOneRec,量复现工业级OneRec!

中科大LDS实验室与Alpha Lab团队联合开源MiniOneRec,是生成式推荐首个完整端到端开源框架。它验证生成式推荐Scaling Law,可量复现OneRec,提供一站式训练与研究平台,技术优势明显。

机器之心
新闻资讯8

刚刚,Gemini 2.5系列模型更新,最新量版Flash-Lite竟能实时编写操作系统

谷歌更新Gemini 2.5系列模型,包括2.5 Pro和Flash稳定版及新推出的Flash-Lite预览版。谷歌CEO称Flash-Lite性价比高,适用于量大且注重成本的任务。报告还提及“智能体恐慌”现象。

机器之心
推荐文章8

LightX2V fp4 quant kernel代码笔记

这是关于 LightX2V 里 `lightx2v_kernel` 做 FP4 量化 GEMM 的读码笔记,解释接口和约束、kernel 关键路径等问题,还介绍 NVFP4 和 MX-Formats 量化原理、代码实现,以及 LightX2V 项目中的实际使用。

GiantPandaLLM
开源动态8

告别大模型“失忆”!人大开源MemSifter:量代理先思考再回忆,搞定长时记忆

中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。

深度学习自然语言处理
开源动态8

AI 本地跑?Google 新开源模型上线,本地量化后占用不到 200MB 内存,支持百余语言

Google DeepMind推出开源嵌入模型EmbeddingGemma,专为本地设备高效运行设计。它用Matryoshka方法和量化感知训练,提升效率。在MTEB测试中成绩佳,支持百余种语言,内存占用少,已集成多种工具。

InfoQ
新闻资讯7

GitHub 2.5万星!日本开发者打造的Hono火了:定义后React时代微框架的量未来

本周,Web 框架 Hono 在 X 官宣,GitHub 获 25000 星标。它由日本开发者 Yusuke Wada 于 2021 年创建,基于 Web 标准,可在多运行时运行,或指明后 React 时代 Web 框架方向。

InfoQ
7

【博客转载】CUDA Vectorized Memory Access (文末送书)

文章展示如何用向量化内存访问提高CUDA函数有效内存带宽,实现朴素自定义设备内存拷贝函数,对比不同数据类型、大小及方法的性能,得出拷贝数据单元多、单元大及以8或16字节向量化单元拷贝可提升带宽等结论。

GiantPandaLLM