Kubernetes AI/ML 工作负载:GPU 调度与训练作业
面向 AI/ML 的 Kubernetes 实战:GPU 资源声明与调度、NVIDIA Device Plugin 与 MIG 共享、TFJob/PyTorchJob 训练作业、KServe 与 vLLM 推理服务、GPU 节点池与成本、调度排队与可观测性。
tag
面向 AI/ML 的 Kubernetes 实战:GPU 资源声明与调度、NVIDIA Device Plugin 与 MIG 共享、TFJob/PyTorchJob 训练作业、KServe 与 vLLM 推理服务、GPU 节点池与成本、调度排队与可观测性。