实时数仓架构实战:Kafka + Flink + ClickHouse 流批一体
从零构建基于 Kafka + Flink + ClickHouse 的实时数仓,涵盖数据采集、流式计算、OLAP 存储与实时大盘的全链路实战。
tag
从零构建基于 Kafka + Flink + ClickHouse 的实时数仓,涵盖数据采集、流式计算、OLAP 存储与实时大盘的全链路实战。
深入 ClickHouse 列式存储引擎:MergeTree 引擎家族、 sparse primary index、向量化执行、物化视图、集群分片与查询优化实战。
系统性可观测性数据存储架构指南:时序数据库对比(Prometheus/Mimir/VictoriaMetrics/Thanos Cortex/InfluxDB/TimescaleDB)、列式存储(ClickHouse/Druid/Pinot)在可观测性中的应用、日志存储对比(Loki/ES/S3+Athena/ClickHouse)、对象存储成本模型与分层策略、数据保留策略(热/温/冷/冻结)、压缩算法与降采样(Downsampling)、OTel Collector 存储后端路由、多云存储成本对比、数据合规与主权。
从行存储与列存储原理出发,深入讲解 HTAP(混合事务/分析处理)架构设计、OLTP 与 OLAP 融合方案,以及 ClickHouse、TiFlash 等实时分析引擎的工程实践。
深入讲解数据仓库、数据湖、湖仓一体架构的演进历程,涵盖维度建模、ETL流程、实时数仓、Iceberg/Hudi等核心技术,提供ClickHouse、Spark的实战案例。
ClickHouse 是一个用于实时分析的列式数据库管理系统,由 Yandex 开发。文章主要介绍 ClickHouse 的架构、查询语言、性能优化等方面。
二、核心架构差异 2.1 ClickHouse 架构 特点: * 典型的 Shared-Nothing 架构 ; * 每个节点都是独立的存储 + 计算单元; * 通过 Distributed 表 跨节点分布查询; * 数据压缩率高 (可达 10x~50x); * 列式存储 + 向量化执行引...