数仓工具分为数仓数据库(存储计算引擎)、ETL / 数据集成、建模开发、调度、元数据 & 数据治理、OLAP 分析引擎几大类,覆盖传统数仓、离线数仓、实时数仓、云原生数仓。
一、数仓存储 & 计算引擎(数仓底座)
传统 MPP 数仓(企业内部、离线为主)
Greenplum 基于 PostgreSQL 的 MPP,开源,适合 PB 级离线数仓,SQL 友好,国内传统企业使用广泛,运维成本中等。
Vertica 列存储 MPP,查询性能强,压缩优秀,商业软件,适合高并发分析。
Teradata(天睿) 传统数仓标杆,硬件一体机,金融运营商老牌选型,成本很高,现在逐步被云 / 开源替代。
GaussDB(DWS) 华为 MPP 数仓,兼容 PG,信创主流选型,支持混合负载,政企项目常用。
AnalyticDB(ADB) 阿里云 MPP 数仓,云托管版本。
Hadoop 生态离线数仓(大数据离线数仓)
Hive 基于 Hadoop 的数据仓库,不是数据库,SQL 翻译 MapReduce/Tez/Spark,构建 HDFS 上的离线数仓,互联网最经典,用于分层 ODS/DWD/DWS/ADS。
存储在 HDFS,计算靠 Spark/Tez,适合海量离线,不适合实时查询。
Spark SQL 替代 Hive MR 计算引擎,现在绝大多数 Hive 数仓底层跑 Spark。

二、实时数仓 OLAP 引擎(实时分析、多维查询)
实时数仓一般:Kafka+Flink 做加工,OLAP 引擎做存储对外查询
ClickHouse 俄罗斯开源,列式存储,实时写入,超快多维查询,广泛用于实时数仓、报表、用户行为分析;缺点:多表 join 弱,事务支持有限。
Doris(Apache Doris) 国产开源 OLAP,MPP 架构,兼顾实时导入 + 离线批量,Join 性能优于 CK,支持标准 SQL,国内大厂实时数仓首选,运维友好。
StarRocks Doris 分支,性能进一步优化,向量化引擎强,高并发报表、实时数仓,很多互联网替换 Doris/CK。
Druid 时序 OLAP,擅长海量时序行为数据,预聚合,适合监控、埋点日志,join 能力弱。
三、ETL / 数据集成工具(数据抽取、清洗、转换)
开源
Apache SeaTunnel 新一代开源数据同步,替代 Sqoop,支持批量 + 实时,大量数据源,支持 Hive、CK、Doris、数据库,现在国内大数据项目主流。
Apache Flink 流批一体计算引擎,实时数仓核心,做实时 ETL 加工;也可以做离线。
Apache Sqoop 老工具,关系库↔HDFS/Hive,只做批量同步,现在逐步被 SeaTunnel 替代。
Kettle(Pentaho Data Integration) 可视化 ETL 工具,拖拽式,适合传统企业简单 ETL,大数据场景性能一般。
商业
DataStage:IBM,传统企业大型 ETL
DataX:阿里开源,批量数据同步工具,国内很多公司自用。
四、工作流调度工具(数仓任务调度)
Airflow 开源,Python 定义 DAG,生态强大,云原生,现在很流行。
Azkaban 雅虎开源,Hadoop 生态老牌调度,配置简单。
DolphinScheduler 国产开源调度,信创友好,可视化界面,支持流批任务,国内政企、大数据项目使用最多。

五、数据建模、元数据、数据治理工具
Apache Atlas 开源元数据管理,血缘采集,标签,数据治理,大数据生态标配。
DataHub LinkedIn 开源元数据平台,现代数据栈,血缘、指标管理。
PowerDesigner 传统 ER 建模工具,数仓概念模型、逻辑模型设计。
DataGrip/DBeaver 通用 SQL 开发客户端,数仓日常开发。
六、云原生数仓(SaaS 数仓,无需自建集群)
Snowflake 全球云数仓标杆,存储计算分离,完全托管。
BigQuery 谷歌云数仓。
Redshift AWS 云数仓。
MaxCompute(ODPS) 阿里大数据数仓,国内云厂商主流。
选型快速参考
传统企业信创离线数仓:GaussDB(DWS) / Greenplum + DolphinScheduler + Atlas
互联网离线大数据数仓:Hive+Spark + SeaTunnel + DolphinScheduler
实时数仓场景:Flink + Doris / StarRocks (优先);简单埋点用 ClickHouse
云环境不想运维集群:MaxCompute / Snowflake
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢