链载Ai

标题: VLLM与PagedAttention实现快速大模型推理服务 [打印本页]

作者: 链载Ai 时间: 昨天 10:44
标题: VLLM与PagedAttention实现快速大模型推理服务

ingFang SC", miui, "Hiragino Sans GB", "Microsoft Yahei", sans-serif;letter-spacing: 0.5px;text-align: start;text-wrap: wrap;background-color: rgb(255, 255, 255);">摘要

ingFang SC", miui, "Hiragino Sans GB", "Microsoft Yahei", sans-serif;text-align: start;background-color: rgb(255, 255, 255);white-space-collapse: preserve !important;word-break: break-word !important;">本文提出了一种名为 PagedAttention 的新型注意力算法，以及一个基于该算法构建的大模型（LLM）服务系统 vLLM。该系统通过高效的内存管理，显著提高了 LLM 的吞吐量。PagedAttention 算法受到操作系统中虚拟内存和分页技术的启发，允许在非连续的分页内存中存储连续的键值对。

ingFang SC", miui, "Hiragino Sans GB", "Microsoft Yahei", sans-serif;text-align: start;background-color: rgb(255, 255, 255);white-space-collapse: preserve !important;word-break: break-word !important;"> vLLM 系统通过块级内存管理和抢占式请求调度，实现了近乎零浪费的键值缓存（KV cache）内存，并在请求之间灵活共享 KV 缓存。实验结果显示，vLLM 在保持相同延迟水平的情况下，将流行 LLM 的吞吐量提高了 2-4 倍。

ingFang SC", miui, "Hiragino Sans GB", "Microsoft Yahei", sans-serif;letter-spacing: 0.5px;text-align: start;text-wrap: wrap;background-color: rgb(255, 255, 255);">问题现状

ingFang SC", miui, "Hiragino Sans GB", "Microsoft Yahei", sans-serif;text-align: start;background-color: rgb(255, 255, 255);white-space-collapse: preserve !important;word-break: break-word !important;">大模型（LLM）的高吞吐量服务需要同时处理大量请求，现有系统在管理每个请求的键值缓存（KV cache）内存时存在挑战，因为这些内存需求巨大且动态变化。当管理效率低下时，内存会因碎片化和冗余复制而显著浪费，限制了批量处理的大小。现有的 LLM 服务系统在管理 KV 缓存内存时存在内部和外部内存碎片化，且无法利用内存共享的机会。

解决方案