article / aiznoyer
VLLM
vllm
vllm
推理加速:内存优化、并行计算、调度策略
内存优化:pageattention:将KV分块,按需分配(allocate_blocks(ceil(current_sequence_length / block_size)))
显存占用大概减少4倍
连续批处理:实时监控请求状态,动态合并正在处理的请求。迭代级调度:每生成一个token重新调整批次;抢占式推理:优先处理低延迟要求的请求
内存池:预先申请大块内存块,循环复用内存块
案例:一开始使用huggingface pipeline吞吐量较低,且长期占用GPU资源,平均延迟较高。
8台h800 qwen-72B实际只跑满了不到3台90%利用率,同时能支持用户数量提高,且体验也有所好转