第 49 章让系统会「看」,第 50 章让系统会「治」,本章让系统会「学」。区别在于:前两章的判断依据来自人写好的规则与阈值,而自学习服务器从自己的运行数据里学习,逐步调整扩缩容策略、分片策略与资源调度。这是全集里对「安全边界」要求最高的一章——一个会自己改参数的生产系统,必须有足够强的护栏和回滚能力才敢上线。
本章定位
- 难度层级:第 6 层(自治世界层)。
- 前置章节:第 49 章 AI 运维检测 与 第 50 章 自愈游戏服务器。三章构成「检测 → 修复 → 学习」的递进链条,建议连读。
- 本章要跨的门槛:在线学习的安全落地——训练与推理必须在生产可控范围内,任何一次策略更新都要能验证、能灰度、能回滚。
核心验证目标
本章 PRD 明确要求验证 Self-Supervised Ops、RL 调整,建议拆解为:
- Self-Supervised Ops:利用系统自身的运行数据构造监督信号(如预测下一时刻指标),减少对人工标注的依赖。
- RL 参数调整:把扩缩容、限流、分片等决策建模为强化学习问题,用奖励信号优化长期收益。
- 在线学习闭环:数据采集、训练、评估、上线的自动化流水线,避免人工搬运。
- 安全边界与回滚:策略更新有灰度与熔断机制,指标恶化时自动回退到上一稳定版本。
- 仿真环境校验:在影子环境或仿真器上先验证策略,再逐步放量到真实流量。
技术栈建议
PRD 基线为 Go / Rust / Python,网络层用 WebSocket over HTTPS 或 gRPC。自学习场景的补充建议:
| 层 | 建议 | 说明 |
|---|---|---|
| 训练与推理 | Python | 强化学习与自监督模型生态最完整 |
| 决策执行 | Go / Rust | 低延迟执行调度与扩缩容动作 |
| 数据管线 | 时序库 + 特征存储 | 训练数据与在线特征统一管理 |
| 实验平台 | 影子流量 + A/B | 新策略先跑影子再放量 |
| 安全 | 熔断 + 回滚 + 人工兜底 | 任何自动决策都要有刹车 |
本章文章
| 文章 | 类型 | 核心内容 |
|---|---|---|
| 在线联机原型全集:第 59 章 自学习服务器(Self-learning Server Brain) | AI 调度脑型 | 用自监督学习与强化学习让服务端持续优化自身的调度与运维策略 |
该 PRD 处于「概念设计阶段」,正文给出系统组成、状态机、事件生命周期与接口定义,可作为自学习运维方向的概念蓝图。
与相邻章节的关系
- 上一章:第 58 章 自治 NPC 社会 —— 世界内智能体的自治,与服务端自身的自治,是本层的两条并行主线。
- 下一章:第 60 章 永续世界 —— 终章把前面所有能力收束成一个可以永续运行、无人值守的世界。
相关专题
- 产品原型开发专题 —— 60 个原型的总入口与路线图。
- AI 专题 —— 自监督学习与强化学习的基础。
- 可观测性专题 —— 自学习依赖高质量的数据与指标。
- Kubernetes 专题 —— 调度决策的最终执行平台。