按数据采集、存储、计算、调度、数仓 / ETL、监控运维、版本协作、查询分析全流程分类,覆盖离线、实时、湖仓一体场景,包含开源主流工具 + 企业商用工具,附适用场景。
一、数据采集工具(源头数据同步、日志采集)
1. 日志实时采集
Flume(Apache)
大数据标配,采集服务器日志、本地文件,对接 Kafka/HDFS,多渠道容错,离线实时通用。
Filebeat(Elastic)
轻量日志采集,资源占用极低,常配合 Logstash,容器 / 云服务器首选。
Logstash
日志清洗过滤、格式转换,搭配 ELK 栈。
2. 数据库全量 / 增量同步(CDC 核心)
Sqoop(Apache)
传统大数据离线同步,MySQL/Oracle ↔ HDFS/Hive,全量导入导出。
DataX(阿里开源)
国内企业首选 ETL 同步工具,速度远超 Sqoop,支持 MySQL、PostgreSQL、Hive、ODPS、ClickHouse 等几十种数据源,离线批量同步。
Canal(阿里开源 CDC)
监听 MySQL binlog,实时捕获增删改数据,推送 Kafka/RocketMQ,实时数仓核心采集工具。
Debezium(开源 CDC)
Kafka Connect 生态,支持 MySQL、Postgres、Oracle、SQLServer,云原生实时 CDC。
Flink CDC
实时流计算内置 CDC,直接捕获数据库变更,无需中间件,实时数仓一体化方案。
3. 消息队列(数据缓冲、解耦,实时链路必备)
Kafka(Apache)
行业标准,高吞吐、持久化,日志、CDC 数据统一中转,大数据实时链路核心。
RocketMQ(阿里开源)
事务消息、延迟消息更完善,金融业务、国内大厂常用。
Pulsar(Apache)
云原生分层存储,多租户,海量 topic,湖仓实时场景新兴选型。
二、分布式存储引擎
1. 离线海量存储(数据湖底层)
HDFS(Apache Hadoop)
大数据基础分布式文件系统,Hive、Spark、Flink 底层存储载体。
对象存储:MinIO、阿里云 OSS、S3
云原生数据湖存储,兼容 S3 协议,替代 HDFS,成本更低。
2. 数仓存储(结构化离线数仓)
Hive(Apache)
基于 HDFS 的数据仓库,SQL 操作海量离线数据,分层数仓 ODS/DWD/DWS/ADS 核心组件。
Iceberg / Hudi / Delta Lake(湖仓一体表格式)
三大主流数据湖格式,支持 ACID、增量更新、时间旅行,统一离线 + 实时存储:
Hudi:更新性能强,实时数仓主流;
Iceberg:兼容性好,多计算引擎通用;
Delta Lake:Databricks 出品,Spark 生态深度绑定。
3. 实时 OLAP 多维分析(即席查询、报表)
ClickHouse
超高并发、秒级聚合查询,实时大屏、用户行为分析首选,国内互联网标配。
Doris(Apache Doris)
湖仓一体 OLAP,兼容 Hive/Iceberg,支持实时入库,替换 ClickHouse 的企业选型。
StarRocks
新一代极速 OLAP,向量化引擎强,实时、离线统一查询。
Druid
时序数据专用 OLAP,监控指标、埋点时序数据聚合。
4. KV / 时序数据库
HBase(Apache)
分布式 KV 数据库,海量明细数据随机读写,用户画像、明细查询。
InfluxDB / Prometheus
时序指标存储,大数据集群监控指标存储。
三、分布式计算引擎(离线 + 实时计算核心)
1. 离线批处理
MapReduce
Hadoop 原生计算引擎,现在极少直接开发,作为底层基础。
Spark Core / Spark SQL
离线计算行业主流,内存计算速度远超 MR,支持 SQL 开发 Hive 数仓,兼容湖仓格式。
2. 实时流计算
Flink(Apache Flink)
实时计算绝对主流,支持 Exactly-Once、窗口计算、CEP 复杂事件处理、Flink CDC,实时数仓、实时大屏核心引擎。
Spark Streaming / Structured Streaming
Spark 实时流,小批量微批,简单实时场景使用。
四、ETL & 数据开发、可视化 SQL 工具
1. 代码开发 IDE
IDEA IntelliJ
大数据开发标配,Java/Scala/Python 开发 Spark、Flink,安装 Hadoop、Big Data 插件。
VS Code
轻量编辑器,支持 Scala、PySpark、SQL,远程服务器开发。
2. SQL 可视化客户端(连接 Hive/Spark/ClickHouse/Doris)
DBeaver
免费通用数据库客户端,支持所有大数据组件,元数据查看、SQL 执行。
DataGrip(JetBrains)
专业 SQL 工具,语法提示、调试、执行计划分析,企业付费首选。
Hue(Apache)
Web 端大数据开发平台,浏览器执行 Hive/Spark SQL、管理 HDFS、查看 Kafka,集群通用 Web 工具。
Zeppelin
Web 交互式笔记本,支持 Spark、Flink、SQL、Python,数据分析、可视化报表。
五、任务调度平台(定时执行离线 / 实时任务)
Azkaban(LinkedIn 开源)
老牌调度工具,Hadoop 生态适配好,简单易用,中小公司常用。
Airflow(Apache)
Python 代码定义 DAG,扩展性极强,云原生,复杂多依赖任务调度,国内外大厂主流。
DolphinScheduler 海豚调度(Apache,国内首选)
国产开源调度,可视化拖拽 DAG,兼容 Spark/Flink/Hive/DataX,支持实时任务、告警、多租户,国内企业大数据平台标配。
XXL-JOB
轻量 Java 调度,简单定时任务、数据同步任务。
六、集群运维、监控、日志排查工具
1. 集群资源管理
YARN(Hadoop)
大数据资源调度框架,Spark/Flink 任务运行容器。
K8s Kubernetes
云原生资源编排,Spark/Flink On K8s,容器化大数据集群。
2. 监控告警
Prometheus + Grafana
监控行业标准,采集 Hadoop、Spark、Flink、Kafka、ClickHouse 指标,可视化大盘 + 告警。
ELK Stack(Elasticsearch + Logstash + Kibana)
日志收集、检索、可视化,排查 Spark/Flink 任务报错日志。
AlertManager
Prometheus 配套告警组件,支持短信、钉钉、邮件告警。
3. 命令行运维工具
mc(MinIO Client):对象存储文件操作
kafka-tools:Kafka 消息消费、topic 管理
hdfs dfs:HDFS 文件命令
yarn logs / yarn application:查看 YARN 任务日志
七、版本管理、协作、数据治理工具
Git / Gitee / GitHub
大数据代码(Spark/Flink 任务、SQL 脚本、调度 DAG)版本管理。
DataWorks 阿里云、MaxCompute、DataStudio
商用一站式大数据开发平台,集采集、开发、调度、治理、可视化一体。
Apache Atlas
数据元数据管理、数据血缘、数据分类,数据治理核心组件。
Apache Griffin
数据质量监控、数据脱敏、数据安全。
八、辅助工具(测试、压测、容器化)
Docker / Docker Compose
本地快速搭建大数据测试集群(Hadoop、Kafka、Flink 一键启动)。
JMeter
Kafka、数据库压测,验证数据采集吞吐量。
Python (PySpark)
轻量大数据开发,数据分析、脚本 ETL。
工具选型极简总结(企业最常用组合)
离线数仓:HDFS + Hive + SparkSQL + DataX + DolphinScheduler
实时数仓:Kafka + Canal/Flink CDC + Flink + Hudi/Iceberg + Doris/ClickHouse
开发运维:IDEA + DBeaver + Hue + Prometheus+Grafana + ELK
数据治理:Atlas + Griffin