低比特量化」共找到 1170 篇相关文章

算法论文7

航空学报|西工大袁昊、寇家庆等:基于预解分析的雷诺数翼型优化设计方法

本文将预解分析引入翼型外形优化,构建流动系统线性化模型,以最大预解增益表征流动稳定性。建立优化框架获Opt.1和Opt.2构型,优化后翼型流动稳定性提升、气动性能改善,方法有外推潜力。

力学与人工智能
推荐文章8

LightX2V fp4 quant kernel代码笔记

这是关于 LightX2V 里 `lightx2v_kernel` 做 FP4 量化 GEMM 的读码笔记,解释接口和约束、kernel 关键路径等问题,还介绍 NVFP4 和 MX-Formats 量化原理、代码实现,以及 LightX2V 项目中的实际使用。

GiantPandaLLM
推荐文章8

AI x 保险图谱:第一家 AI-Native 的保险独角兽会长什么样?

保险业规模庞大但运营效率极,超 60%流程依赖人工,索赔周期长、客户满意度。过去两年,LLMs 提升了 AI 处理非结构化信息的能力,使 AI 接管保险核心流程成为可能。GenAI startup 围绕保险流程构建产品,AI-native 保险公司也应运而生。

海外独角兽
开源动态8

AI 本地跑?Google 新开源模型上线,本地量化后占用不到 200MB 内存,支持百余语言

Google DeepMind推出开源嵌入模型EmbeddingGemma,专为本地设备高效运行设计。它用Matryoshka方法和量化感知训练,提升效率。在MTEB测试中成绩佳,支持百余种语言,内存占用少,已集成多种工具。

InfoQ
新闻资讯8

OpenAI公布首颗自研推理芯片成绩,下一代已进入制造阶段

8月25日,OpenAI公布自研推理芯片Jalapeño性能测试结果,首次给出其在多款公开大模型上的具体数据。该芯片在功耗下实现高推理吞吐量和延迟,性能超英伟达芯片,B0版已进入制造阶段。

DeepTech深科技
7

【博客转载】CUDA Vectorized Memory Access (文末送书)

文章展示如何用向量化内存访问提高CUDA函数有效内存带宽,实现朴素自定义设备内存拷贝函数,对比不同数据类型、大小及方法的性能,得出拷贝数据单元多、单元大及以8或16字节向量化单元拷贝可提升带宽等结论。

GiantPandaLLM
产品应用7

突袭Cursor,Windsurf抢发自研大模型!性能比肩Claude 3.5、但成本更,网友好评:响应快、不废话

当地时间5月16日,Windsurf推出首个AI软件工程模型家族SWE - 1,含三款模型,性能比肩Claude 3.5且成本更。开发者试用评价不错,但也指出不足。Windsurf称旨在提升软件开发速度,还介绍了测评、编辑器赋能等情况。

AI前线
推荐文章7

长尾的复兴

作者曾认为3D打印在制造业是旁支末流,天花板。如今看法转变,认为AI加3D打印将长尾从比特推进到原子,长尾社区也成熟,让小众需求有规模化满足可能,创客和业余爱好者迎来复兴。

乱翻书
算法论文8

半量工具,双倍效能:ARPO革新大模型强化学习

大语言模型在多轮工具调用场景有挑战,传统强化学习算法有探索效率和资源消耗大问题。本文提出ARPO,通过量化token熵分布变化设计自适应探索机制,降工具调用成本且提升多轮推理性能。

深度学习自然语言处理
算法论文8

港科广×腾讯联手打造《我的世界》神操作,400张截图就能让AI挖矿通关,成本降至5%|EMNLP 2025

港科广与腾讯联合团队提出VistaWise框架,将“跨模态知识图谱+轻量化视觉微调”引入开放世界智能体。实验显示其在“获取钻石”任务表现出色,成果被EMNLP 2025主会录用。该框架以成本、跨模态为突破口。

量子位