一、数据仓库的核心概念
数据仓库(Data Warehouse)是面向主题的、集成的、稳定的、反映历史变化的数据集合,用于支持管理决策分析。与业务数据库(OLTP)不同,数仓面向分析(OLAP),存储历史数据、支持复杂查询。数仓将分散的源系统数据统一整合,形成企业的"单一数据源"。
一)数仓的分层架构
经典数仓分层:ODS(贴源层,原样存储源数据)→ DWD(明细层,清洗加工)→ DWS(汇总层,主题聚合)→ ADS(应用层,面向报表和应用的宽表)。分层让数据处理有清晰的职责,隔离变更影响,提升复用性。每层之间通过任务调度串连。
二、数仓建模方法论
维度建模是主流方法:事实表(度量业务过程) + 维度表(描述业务属性)。星型模型(事实表居中,维度表环绕)查询性能好;雪花模型维度表规范化,节省空间。总线架构(一致性维度)保证跨主题分析的一致性。建模是数仓的核心,好的模型让分析事半功倍。
一)数仓的技术栈选型
离线数仓常用 Hive/Spark + HDFS,实时数仓用 Kafka + Flink + ClickHouse/Doris,湖仓一体(Iceberg/Hudi)融合数据湖与数仓。云数仓(Snowflake、Redshift)弹性扩展。选型结合数据量、时效性、成本和团队能力。2026年的趋势是实时化和智能化。
三、数仓的数据治理
数据治理保障数据质量:元数据管理(血缘、字典)、数据质量监控(完整性、准确性)、数据安全(权限、脱敏)。数据开发平台(调度、告警、运维)提升效率。数仓是长期建设的工程,治理让数据可信可用。