到第 49 章,原型全集的关注点发生了一次明显的转向:不再问「玩家体验什么」,而问「服务器自己出了毛病,能不能提前知道」。这一章是后续第 50 章自愈服务器、第 59 章自学习服务器的共同前置——先要能「看见」异常,才谈得上「自动修复」和「自我学习」。
本章定位
- 难度层级:第 5 层(概念原型层)。
- 前置章节:第 37 章 战斗录像与分析系统。第 37 章建立了行为与指标的采集管线,本章把这套数据用于服务侧异常检测。
- 本章要跨的门槛:从「规则阈值告警」升级到「模型预测告警」,同时必须解决误报率和告警风暴,否则模型再准也没人敢用。
核心验证目标
本章 PRD 明确要求验证 LSTM 检测、自愈规则,建议拆成以下可验收点:
- 指标与日志采集管线:把 CPU、内存、延迟、连接数、错误率等时序指标与结构化日志稳定汇聚到检测侧。
- LSTM 时序异常检测:用滑动窗口训练/推理,输出异常分数,与静态阈值方案做对比评估。
- 告警降噪与分级:对同源告警做聚合与抑制,按严重级别路由,避免告警风暴淹没真实故障。
- 自愈规则引擎:把「检测到异常」映射为「执行什么动作」的规则(扩缩容、限流、重启),规则可配置、可审计。
- 与自愈执行的联动:向第 50 章的自愈服务器输出结构化事件,而不是直接执行,保证职责边界清晰。
技术栈建议
PRD 基线为 Go / Rust / Python,网络层用 WebSocket over HTTPS 或 gRPC。检测场景的补充建议:
| 层 | 建议 | 说明 |
|---|---|---|
| 指标采集 | Prometheus 生态 + 时序库 | 原型期直接复用成熟采集栈 |
| 模型训练与推理 | Python | LSTM 等时序模型生态最完整 |
| 规则引擎 | Go / Rust | 规则执行要求低延迟、可热更新 |
| 事件通道 | 消息队列 / 事件总线 | 检测结果异步投递给自愈执行侧 |
| 评估 | 离线回放 + 误报率统计 | 用历史数据验证模型,避免线上试错 |
本章文章
| 文章 | 类型 | 核心内容 |
|---|---|---|
| 在线联机原型全集:第 49 章 AI 运维检测(AI Ops & Anomaly Detection) | 异常预测型 | 用 LSTM 对时序指标做异常预测,并把结论转化为可执行的自愈规则 |
该 PRD 处于「概念设计阶段」,正文给出系统组成、状态机、事件生命周期与接口定义,适合作为 AIOps 能力的立项蓝图。
与相邻章节的关系
- 上一章:第 48 章 平台经济系统 —— 收益链路是稳定性最敏感的消费者,本章为它提供异常预警。
- 下一章:第 50 章 自愈游戏服务器 —— 本章负责「检测」,下一章负责「修复」,二者构成完整的 AIOps 闭环。
相关专题
- 产品原型开发专题 —— 60 个原型的总入口与路线图。
- 可观测性专题 —— 指标、日志、链路追踪的工程基础。
- AI 专题 —— 时序模型与异常检测算法基础。
- Kubernetes 专题 —— 自愈动作最终要落到编排系统上执行。