<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Training on PlumePHP</title><link>https://plumephp.com/tags/training/</link><description>Recent content in Training on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 30 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/training/index.xml" rel="self" type="application/rss+xml"/><item><title>Kubernetes AI/ML 工作负载：GPU 调度与训练作业</title><link>https://plumephp.com/kubernetes-ai-ml-gpu/</link><pubDate>Wed, 30 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/kubernetes-ai-ml-gpu/</guid><description>&lt;p&gt;K8s 调度 CPU 负载很简单，但一上 GPU 就变成另一回事：&lt;strong&gt;GPU 是&amp;quot;不可拆分&amp;quot;的大资源、驱动要装、显存会打爆、训练要&amp;quot;整组进程一起调度&amp;quot;、推理要低延迟高吞吐&lt;/strong&gt;。本指南把 AI/ML 工作负载上 K8s 的完整链路讲清楚：怎么声明和调度 GPU、怎么用 NVIDIA Device Plugin 与 MIG 把大卡切小、训练作业（TFJob/PyTorchJob）怎么写、推理服务（KServe/vLLM）怎么部署，以及节点池、成本与可观测性的一揽子方案。&lt;/p&gt;</description></item></channel></rss>