大语言模型中基于GPU加速的INT8量化键值缓存压缩技术 (GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models) - 专知论文

会员服务 ·

0

INT8 · 内存 · GPU · 向量化 · 语言模型 ·

GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models

翻译：大语言模型中基于GPU加速的INT8量化键值缓存压缩技术

Maanas Taneja,Purab Shingvi

The key-value (KV) cache in large language models presents a significant memory bottleneck during inference, growing linearly with sequence length and often exceeding the memory footprint of model weights themselves. We implement and evaluate GPU-accelerated INT8 quantization for KV cache compression, achieving 4$\times$ memory reduction with minimal accuracy degradation. We develop four CUDA kernel variants -- naive, tiled, coarsened, and vectorized -- and benchmark them across realistic workload sizes up to 1 billion elements. Our vectorized kernel achieves up to 1,694$\times$ speedup over CPU baselines while maintaining reconstruction error below 0.004 and attention score error below 0.1 even for 8K-dimensional heads. These results demonstrate that INT8 quantization provides a practical approach for reducing memory pressure in LLM inference with negligible computational overhead (6--58ms) and minimal impact on downstream model behavior

翻译：大型语言模型中的键值（KV）缓存已成为推理过程中的显著内存瓶颈，其容量随序列长度线性增长，并常超过模型权重本身的内存占用。我们实现并评估了基于GPU加速的INT8量化KV缓存压缩方案，在精度损失最小的前提下实现了4倍内存压缩。我们开发了四种CUDA内核变体——基础版、分块版、粗粒度版和向量化版，并在高达10亿元素的实际工作负载规模上进行了基准测试。我们的向量化内核相比CPU基线实现了最高1,694倍的加速比，同时即使面对8K维注意力头，其重构误差仍低于0.004，注意力分数误差低于0.1。这些结果表明，INT8量化为缓解LLM推理内存压力提供了实用方案，其计算开销可忽略不计（6-58毫秒），且对下游模型行为的影响微乎其微。

0

相关内容

INT8

LaCache：用于高效长上下文建模的大语言模型梯状KV缓存机制

LaCache：用于高效长上下文建模的大语言模型梯状KV缓存机制

专知会员服务

11+阅读 · 2025年7月23日

TransMLA：多头潜在注意力（MLA）即为所需

TransMLA：多头潜在注意力（MLA）即为所需

专知会员服务

23+阅读 · 2025年2月13日

低比特大语言模型综述：基础、系统与算法

低比特大语言模型综述：基础、系统与算法

专知会员服务

28+阅读 · 2024年10月6日

大模型的模型压缩与有效推理综述

大模型的模型压缩与有效推理综述

专知会员服务

43+阅读 · 2024年7月8日

《大型语言模型加速生成技术》最新综述

《大型语言模型加速生成技术》最新综述

专知会员服务

50+阅读 · 2024年5月25日

大型语言模型的模型压缩与高效推理：综述

大型语言模型的模型压缩与高效推理：综述

专知会员服务

94+阅读 · 2024年2月17日

更快更轻量的大型语言模型：当前挑战及未来发展路径综述

更快更轻量的大型语言模型：当前挑战及未来发展路径综述

专知会员服务

42+阅读 · 2024年2月8日

如何提升大模型效率？微软等最新《大型语言模型的效率算法》综述

如何提升大模型效率？微软等最新《大型语言模型的效率算法》综述

专知会员服务

46+阅读 · 2023年12月5日

中国科学院团队首篇《大语言模型LLM模型压缩》综述：细聊剪枝、知识蒸馏、量化技术

中国科学院团队首篇《大语言模型LLM模型压缩》综述：细聊剪枝、知识蒸馏、量化技术

专知会员服务

74+阅读 · 2023年8月27日

【NLP模型压缩方法综述】《A Survey of Methods for Model Compression in NLP》by Madison May

【NLP模型压缩方法综述】《A Survey of Methods for Model Compression in NLP》by Madison May

专知会员服务

43+阅读 · 2020年4月22日

Keras新增TextVectorization层，可直接将文本字符串作为模型输入

Keras新增TextVectorization层，可直接将文本字符串作为模型输入

专知

19+阅读 · 2019年11月22日

[Google]BERT压缩到7MB！最新基于最优子词和共享投影的极限语言压缩模型

[Google]BERT压缩到7MB！最新基于最优子词和共享投影的极限语言压缩模型

专知

31+阅读 · 2019年10月6日

谷歌EfficientNet缩放模型，PyTorch实现登热榜

谷歌EfficientNet缩放模型，PyTorch实现登热榜

机器学习算法与Python学习

11+阅读 · 2019年6月4日

【资源】深度学习模型压缩资源汇总

【资源】深度学习模型压缩资源汇总

专知

38+阅读 · 2019年5月8日

【资源推荐】模型压缩与加速相关资源汇总

【资源推荐】模型压缩与加速相关资源汇总

专知

17+阅读 · 2019年3月27日

【最新综述】模型压缩与加速（附论文全文下载）

【最新综述】模型压缩与加速（附论文全文下载）

专知

28+阅读 · 2019年2月14日

【优青论文】深度神经网络压缩与加速综述

【优青论文】深度神经网络压缩与加速综述

计算机研究与发展

17+阅读 · 2018年9月20日

超全总结：神经网络加速之量化模型 | 附带代码

超全总结：神经网络加速之量化模型 | 附带代码

PaperWeekly

12+阅读 · 2018年6月1日

如何设计基于深度学习的图像压缩算法

如何设计基于深度学习的图像压缩算法

论智

41+阅读 · 2018年4月26日

CNN 模型压缩与加速算法综述

CNN 模型压缩与加速算法综述

机器学习研究会

16+阅读 · 2017年8月25日

基于压缩感知理论的图像采样、编码和重建研究

国家自然科学基金

1+阅读 · 2015年12月31日

云计算平台中大规模交互式服务长尾延迟消减关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向CELP语音压缩域的通用隐写分析方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于压缩感知的信号重建快速算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向长尾现象的数据缓存技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于动态匹配的高能量利用率多层堆叠结构静态随机存储器（SRAM）关键技术

国家自然科学基金

0+阅读 · 2015年12月31日

面向存储受限应用的GPU性能预测模型和通信优化关键技术研究

国家自然科学基金

2+阅读 · 2015年12月31日

压缩感知和稀疏优化中的非凸优化算法设计

国家自然科学基金

2+阅读 · 2014年12月31日

基于压缩域的海量视频浓缩关键技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向大数据计算的高吞吐量众核处理器关键技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

KVzap: Fast, Adaptive, and Faithful KV Cache Pruning

Arxiv

0+阅读 · 2月3日

DynSplit-KV: Dynamic Semantic Splitting for KVCache Compression in Efficient Long-Context LLM Inference

Arxiv

0+阅读 · 2月3日

Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model

Arxiv

0+阅读 · 2月2日

KVmix: Gradient-Based Layer Importance-Aware Mixed-Precision Quantization for KV Cache

Arxiv

0+阅读 · 2月2日

Competitive Non-Clairvoyant KV-Cache Scheduling for LLM Inference

Arxiv

0+阅读 · 1月30日

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

Arxiv

0+阅读 · 1月28日

R-KV: Redundancy-aware KV Cache Compression for Reasoning Models

Arxiv

0+阅读 · 1月22日

Joint Encoding of KV-Cache Blocks for Scalable LLM Serving

Arxiv

0+阅读 · 1月6日

BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache

Arxiv

0+阅读 · 1月5日

KVCrush: Key value cache size-reduction using similarity in head-behaviour

Arxiv

0+阅读 · 1月5日

VIP会员

文章信息

相关主题

相关VIP内容

LaCache：用于高效长上下文建模的大语言模型梯状KV缓存机制

LaCache：用于高效长上下文建模的大语言模型梯状KV缓存机制

专知会员服务

11+阅读 · 2025年7月23日

TransMLA：多头潜在注意力（MLA）即为所需

TransMLA：多头潜在注意力（MLA）即为所需

专知会员服务

23+阅读 · 2025年2月13日

低比特大语言模型综述：基础、系统与算法

低比特大语言模型综述：基础、系统与算法

专知会员服务

28+阅读 · 2024年10月6日

大模型的模型压缩与有效推理综述

大模型的模型压缩与有效推理综述

专知会员服务

43+阅读 · 2024年7月8日

《大型语言模型加速生成技术》最新综述

《大型语言模型加速生成技术》最新综述

专知会员服务

50+阅读 · 2024年5月25日

大型语言模型的模型压缩与高效推理：综述

大型语言模型的模型压缩与高效推理：综述

专知会员服务

94+阅读 · 2024年2月17日

更快更轻量的大型语言模型：当前挑战及未来发展路径综述

更快更轻量的大型语言模型：当前挑战及未来发展路径综述

专知会员服务

42+阅读 · 2024年2月8日

如何提升大模型效率？微软等最新《大型语言模型的效率算法》综述

如何提升大模型效率？微软等最新《大型语言模型的效率算法》综述

专知会员服务

46+阅读 · 2023年12月5日

中国科学院团队首篇《大语言模型LLM模型压缩》综述：细聊剪枝、知识蒸馏、量化技术

中国科学院团队首篇《大语言模型LLM模型压缩》综述：细聊剪枝、知识蒸馏、量化技术

专知会员服务

74+阅读 · 2023年8月27日

【NLP模型压缩方法综述】《A Survey of Methods for Model Compression in NLP》by Madison May

【NLP模型压缩方法综述】《A Survey of Methods for Model Compression in NLP》by Madison May

专知会员服务

43+阅读 · 2020年4月22日

热门VIP内容

开通专知VIP会员享更多权益服务

智能体记忆深度剖析：评价指标与系统局限性的分类体系及实证分析

《可信人工智能赋能系统的支柱》

【CMU博士论文】可靠轨迹预测的分层基石：数据、评估与方法

人工智能赋能边缘与自主系统：美陆军现代化进程聚焦威胁探测与战术边缘情报

相关资讯

Keras新增TextVectorization层，可直接将文本字符串作为模型输入

Keras新增TextVectorization层，可直接将文本字符串作为模型输入

专知

19+阅读 · 2019年11月22日

[Google]BERT压缩到7MB！最新基于最优子词和共享投影的极限语言压缩模型

[Google]BERT压缩到7MB！最新基于最优子词和共享投影的极限语言压缩模型

专知

31+阅读 · 2019年10月6日

谷歌EfficientNet缩放模型，PyTorch实现登热榜

谷歌EfficientNet缩放模型，PyTorch实现登热榜

机器学习算法与Python学习

11+阅读 · 2019年6月4日

【资源】深度学习模型压缩资源汇总

【资源】深度学习模型压缩资源汇总

专知

38+阅读 · 2019年5月8日

【资源推荐】模型压缩与加速相关资源汇总

【资源推荐】模型压缩与加速相关资源汇总

专知

17+阅读 · 2019年3月27日

【最新综述】模型压缩与加速（附论文全文下载）

【最新综述】模型压缩与加速（附论文全文下载）

专知

28+阅读 · 2019年2月14日

【优青论文】深度神经网络压缩与加速综述

【优青论文】深度神经网络压缩与加速综述

计算机研究与发展

17+阅读 · 2018年9月20日

超全总结：神经网络加速之量化模型 | 附带代码

超全总结：神经网络加速之量化模型 | 附带代码

PaperWeekly

12+阅读 · 2018年6月1日

如何设计基于深度学习的图像压缩算法

如何设计基于深度学习的图像压缩算法

论智

41+阅读 · 2018年4月26日

CNN 模型压缩与加速算法综述

CNN 模型压缩与加速算法综述

机器学习研究会

16+阅读 · 2017年8月25日

相关论文

KVzap: Fast, Adaptive, and Faithful KV Cache Pruning

Arxiv

0+阅读 · 2月3日

DynSplit-KV: Dynamic Semantic Splitting for KVCache Compression in Efficient Long-Context LLM Inference

Arxiv

0+阅读 · 2月3日

Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model

Arxiv

0+阅读 · 2月2日

KVmix: Gradient-Based Layer Importance-Aware Mixed-Precision Quantization for KV Cache

Arxiv

0+阅读 · 2月2日

Competitive Non-Clairvoyant KV-Cache Scheduling for LLM Inference

Arxiv

0+阅读 · 1月30日

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

Arxiv

0+阅读 · 1月28日

R-KV: Redundancy-aware KV Cache Compression for Reasoning Models

Arxiv

0+阅读 · 1月22日

Joint Encoding of KV-Cache Blocks for Scalable LLM Serving

Arxiv

0+阅读 · 1月6日

BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache

Arxiv

0+阅读 · 1月5日

KVCrush: Key value cache size-reduction using similarity in head-behaviour

Arxiv

0+阅读 · 1月5日

相关基金

基于压缩感知理论的图像采样、编码和重建研究

国家自然科学基金

1+阅读 · 2015年12月31日

云计算平台中大规模交互式服务长尾延迟消减关键技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向CELP语音压缩域的通用隐写分析方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于压缩感知的信号重建快速算法研究

国家自然科学基金

0+阅读 · 2015年12月31日

面向长尾现象的数据缓存技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于动态匹配的高能量利用率多层堆叠结构静态随机存储器（SRAM）关键技术

国家自然科学基金

0+阅读 · 2015年12月31日

面向存储受限应用的GPU性能预测模型和通信优化关键技术研究

国家自然科学基金

2+阅读 · 2015年12月31日

压缩感知和稀疏优化中的非凸优化算法设计

国家自然科学基金

2+阅读 · 2014年12月31日

基于压缩域的海量视频浓缩关键技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向大数据计算的高吞吐量众核处理器关键技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员