aivLLM 深度解析:连续批处理与内存高效推理大语言模型(LLM)推理服务的扩展性瓶颈,往往不在计算吞吐量,而在 GPU 显存。传统推理框架将 KV Cache 以连续张量形式预分配,造成大量内存浪费,导致 batch size 被严重限制。2026-09-109 分钟阅读vLLM LLM 推理系统