category

Sre

共 13 篇文章。
全部文章GameGolangSaaSRust游戏开发客户端开发GameDevLuaIndie写作小说PrdClientDeveloper
infra

可观测性数据存储选型:TSDB、列式存储、对象存储与成本优化

系统性可观测性数据存储架构指南:时序数据库对比(Prometheus/Mimir/VictoriaMetrics/Thanos Cortex/InfluxDB/TimescaleDB)、列式存储(ClickHouse/Druid/Pinot)在可观测性中的应用、日志存储对比(Loki/ES/S3+Athena/ClickHouse)、对象存储成本模型与分层策略、数据保留策略(热/温/冷/冻结)、压缩算法与降采样(Downsampling)、OTel Collector 存储后端路由、多云存储成本对比、数据合规与主权。

4 分钟阅读
observability storage tsdb
infra

云原生 APM 与性能剖析:Continuous Profiling 与火焰图

系统性云原生 APM 实战指南:APM 架构与 Agent 模式(自动插桩/字节码注入/eBPF 零侵扰)、OpenTelemetry APM 链路、持续性能剖析(Continuous Profiling)概念与价值、Go pprof / Java async-profiler / Python py-spy / Rust flamegraph 实践、CPU 火焰图 / 内存分配图 / Goroutine 阻塞图 / 锁竞争图解读、Grafana Profiles(Pyroscope/Parca)部署、APM 与 Metrics/Logs/Traces 的协同、性能基线建立与回归检测、Profiling 数据采样与低开销策略、生产环境 Profiling 安全实践。

4 分钟阅读
apm profiling performance
infra

Kubernetes 可观测性实战:集群、Pod、网络、存储全链路监控

系统性 Kubernetes 可观测性实战指南:K8s 分层监控模型(集群/节点/Pod/容器/应用/API Server/etcd)、kubelet/cAdvisor/Metrics Server/Node Exporter 指标详解、Vertical Pod Autoscaler (VPA) / Horizontal Pod Autoscaler (HPA) 监控、Kubernetes Events / Audit Logs / Control Plane 日志、网络可观测性(CNI / kube-proxy / CoreDNS / Ingress)、存储可观测性(PVC/StorageClass/CSI driver metrics)、K8s 告警规则(Prometheus Rule)、Grafana K8s Dashboard 生态(社区模板/自定义)、Kubectl resource metrics / stern / k9s 排障工具链。

3 分钟阅读
kubernetes observability prometheus
infra

eBPF 可观测性:内核可编程追踪与性能剖析

系统性 eBPF 可观测性实战:eBPF 架构与执行模型(Verifier/JIT/maps/Helper)、BCC 与 libbpf 开发框架对比、BPF 程序类型(kprobe/tracepoint/uprobe/XDP/TC/socket)、Go eBPF 开发(cilium/ebpf 库)、常见可观测性场景(函数追踪/延迟分析/火焰图/网络丢包/文件 IO/TCP 连接)、eBPF 安全与权限(CAP_BPF)、性能开销控制、与 Prometheus/Grafana 集成。附 C/libbpf 和 Go 实战代码。

5 分钟阅读
ebpf bpf kernel
infra

SLO、SLI 与错误预算:数据驱动的可靠性工程

系统性 SRE 可靠性工程指南:SLI(Service Level Indicator)选取方法论、SLO(Service Level Objective)目标设定、错误预算定义与消费、Burn Rate 告警策略、多窗口多阈值告警(Multi-window Multi-burn-rate Alerting)、服务水平协议(SLA)与 SLO 的区别、基于错误预算的发布策略(发布窗口/金丝雀阈值)、SLO 监控面板设计、SLO 文化与团队治理。附 Google SRE 示例与 Prometheus/Grafana 实战配置。

5 分钟阅读
sre slo sli
infra

告警设计与事件响应:降噪、分级、值班与事后复盘

系统性告警与事件响应实战指南:告警设计的黄金法则(可行动性/关联上下文/优先级/渐进式)、Four Golden Signals 与 USE/RED 方法论、告警分级(P0/P1/P2/P3)与升级策略、告警疲劳根因分析与降噪手段(抑制/聚合/去重/依赖静默)、值班轮换(on-call)制度、事件响应 SOP(检测/评估/缓解/复盘)、ChatOps / Runbook 自动化、事后复盘模板(Postmortem)与无责文化、MTTR/MTBF/MTTF 指标定义与追踪、PagerDuty/Opsgenie 集成实践。

8 分钟阅读
alerting incident-response on-call
infra

日志系统全栈:Loki、EFK、Vector 与日志架构设计

系统性日志系统实战指南:日志采集架构设计(DaemonSet/Sidecar/应用直推)、Loki 架构(Distributor/Ingester/Querier/Compactor/Index Gateway)、LogQL 查询语言、Loki 对象存储后端与分片策略、EFK 栈(Elasticsearch/Fluentd/Kibana)生产部署、Vector(Rust 高性能日志采集器)配置与拓扑、日志结构化(JSON/OTLP)与解析(Regex/Grok/CSV)、日志压缩与保留策略、日志安全(脱敏/审计/权限)、日志与 Trace/Metrics 关联。附完整 Kubernetes 部署配置。

6 分钟阅读
logging loki efk
infra

分布式追踪实战:Jaeger、Tempo 与采样策略

系统性分布式追踪实战指南:Trace 数据模型(Span/Trace/Context/Links)、分布式追踪头传播(W3C Trace Context / B3 / Jaeger)、Jaeger Agent/Collector/Query/UI 部署架构、Tempo 低成本对象存储架构、头部采样 vs 尾部采样 vs 自适应采样、TraceQL 查询语言、Span/Event/Attribute 最佳实践、Trace 与 Metrics/Logs 关联(Exemplars/OpenTelemetry)、性能开销分析与优化、追踪驱动的延迟分析(关键路径/火焰图)、全链路压测追踪。附 Go/Java/Node.js 实战与 Kubernetes 部署 YAML。

6 分钟阅读
distributed-tracing jaeger tempo
infra

OpenTelemetry 完全指南:标准化可观测性框架

系统性 OpenTelemetry 实战指南:OTel 架构与核心理念、自动与手动 Instrumentation、Span/Trace/Context 传播、Metrics SDK / Logs SDK / Baggage、语义约定(Semantic Conventions)与资源属性、OTel Collector 架构与 processors/exporters、采样策略(AlwaysOn/Sampler/Parent-based/Rate-limiting)、OTLP 协议、与 Prometheus/Jaeger/Loki 的桥接、Go/Java/Node.js/Python 多语言实战代码。

6 分钟阅读
opentelemetry tracing instrumentation
infra

Grafana 可视化与仪表盘设计:从数据到洞察

系统性 Grafana 实战指南:数据源配置(Prometheus/Loki/Tempo/MySQL/Elasticsearch)、仪表盘设计原则(OLAP 原则/颜色语义/信息层次/Golden Signals)、变量与模板化(Query/Text/Custom/Interval/Datasource)、多面板联动与钻取、Alerting 规则(Grafana 告警 vs Alertmanager)、Annotation 与事件叠加、Grafana Loki 日志查询面板、Grafana Tempo 追踪面板、面板类型选择(Time Series/Stat/Table/Heatmap/Gauge/Logs/Node Graph/Canvas)、公共分享与嵌入、Grafana 权限模型与组织管理。附生产级 Dashboard JSON 模板。

7 分钟阅读
grafana dashboard visualization
infra

Prometheus 深度解析:指标采集、PromQL、服务发现、Recording Rule 与 Alertmanager

系统级 Prometheus 实战指南:数据模型与指标类型详解、Exporter 生态与自定义 Exporter 开发、服务发现机制(DNS/K8s/Consul/File SD)、PromQL 高级查询(聚合/子查询/二元运算/预测/同比环比)、Recording Rule 与告警规则设计、Alertmanager 分组/抑制/静默/路由、高可用联邦与远程存储、Thanos/VictoriaMetrics 扩展架构。附完整配置与实战代码。

5 分钟阅读
prometheus promql metrics
infra

可观测性三大支柱深度解析:指标、日志、追踪

系统性梳理可观测性三大支柱(Metrics/Logs/Traces)的核心概念、数据模型、采集范式和适用场景。对比维度覆盖数据类型、查询方式、存储成本、采样策略、告警响应、根因定位。延伸至事件(Events)、剖析(Profiling)、真实用户监控(RUM)等第四/第五支柱,构建完整的云原生可观测性认知框架。

7 分钟阅读
observability metrics logs