vLLM KV Cache 池化:Mooncake + MultiConnector 生产级实践
Mooncake Master + MultiConnector(MooncakeConnectorV1 + AscendStoreConnector)双层 KV Cache 池化架构的完整实践指南:从原理到 GLM-5.2 生产配置,涵盖前缀缓存、SSD 卸载、Decode KV 回写和排障。
vLLMKV CacheMooncakeAscend NPU推理优化PD分离
高级运维工程师 / SRE,10 年经验。专注 Kubernetes GPU 集群运维、AI 基础设施、 可观测性体系建设与自动化平台工程。这里是技术实践的沉淀空间。
Mooncake Master + MultiConnector(MooncakeConnectorV1 + AscendStoreConnector)双层 KV Cache 池化架构的完整实践指南:从原理到 GLM-5.2 生产配置,涵盖前缀缓存、SSD 卸载、Decode KV 回写和排障。
KubeRay 架构全景解析:RayCluster/RayJob/RayService 三层 CRD、vLLM + Ray Serve 多节点 TP 推理、PD 分离编排,以及 9 个 K8s LLM 推理项目的横向对比与选型建议。
vLLM 投机解码(Speculative Decoding)三种方案深度对比:MTP(GLM-5.2 内置)、Eagle3(Kimi-K2.6)、Draft Model,含 Ascend NPU 真实生产配置、吞吐提升实测和排坑指南。
华为昇腾 NPU 上部署 vLLM 的完整指南:NPU 设备检测、Docker/Docker Compose/Kubelet 四种部署方式、Qwen3/DeepSeek/GLM 等 30+ 模型支持,以及 PD 分离和监控。
FP16/W8A8/W4A8/FP8/AWQ/GPTQ 六种量化方案对比,含显存估算公式、Ascend 910B 实测数据(GLM-5.2-w8a8 / Kimi-K2.6-w4a8),以及生产选型决策树。