按数据采集、存储、计算引擎、实时流处理、数据仓库 / OLAP、调度、治理、可视化完整链路分类,区分离线、实时、批流一体,附适用场景与核心优势。
一、数据采集工具(多源数据接入)
1. Apache Flume
定位:日志专用采集框架
场景:服务器日志、应用日志实时收集,落地 HDFS/Hive/Kafka
特点:分布式、容错、可拦截过滤,轻量无侵入
2. Apache Sqoop
定位:关系型数据库 ↔ Hadoop 批量同步
场景:MySQL/Oracle/PostgreSQL 全量 / 增量导入 HDFS/Hive
特点:基于 MapReduce 并行传输,支持分库分表
3. Apache Kafka Connect
定位:通用流式同步(CDC / 数据库 / 文件)
场景:实时数据库同步、CDC 增量捕获、跨系统数据流打通
配套:Debezium(主流 CDC 插件,捕获 MySQL/PG/Oracle binlog)
4. DataX(阿里开源)
定位:高性能离线数据同步工具
场景:异构数据库、HDFS、ODPS 之间高速批量传输
优势:单节点高吞吐,插件化数据源,轻量易部署
5. Logstash(ELK)
定位:日志清洗转换采集
场景:日志过滤、字段提取、格式转换,对接 Elasticsearch
二、分布式存储(海量数据持久化底座)
1. HDFS(Hadoop Distributed File System)
定位:大数据标准分布式文件系统
场景:离线数仓底层存储,海量非结构化 / 半结构化数据
特点:高可靠、高吞吐、一次写入多次读取
2. Apache HBase
定位:分布式 NoSQL 列存储数据库
场景:实时在线海量 KV 查询、时序数据、用户画像
特点:随机实时读写,支持百亿行千万列,底层依赖 HDFS
3. Apache Iceberg / Delta Lake / Hudi(湖存储格式)
三大数据湖标准,解决 HDFS 数据更新、事务、Schema 演进问题:
Delta Lake(Databricks):Spark 生态最佳适配,ACID 事务
Apache Hudi:增量更新、CDC 写入、时间旅行,实时数仓首选
Apache Iceberg:跨计算引擎(Spark/Flink/Presto),无绑定
4. MinIO
定位:对象存储(兼容 S3)
场景:轻量化数据湖、离线文件存储、替代 HDFS 中小集群
三、批处理计算引擎(离线大数据分析)
1. Apache Spark(最主流)
定位:通用分布式批处理引擎,内存计算
组件:Spark Core、Spark SQL、Spark Streaming、MLlib 机器学习、GraphX 图计算
场景:离线 ETL、海量数据统计、机器学习、交互式 SQL 查询
优势:比 MapReduce 快 10~100 倍,批流一体 API
2. Apache Hadoop MapReduce
定位:初代离线计算框架
场景:简单批量任务、老旧数仓兼容
缺点:磁盘 IO 多,性能偏低,逐步被 Spark 替代
3. Apache Tez
定位:DAG 计算框架,优化 MapReduce
场景:Hive 底层执行引擎,复杂多阶段 SQL,减少磁盘落盘
四、实时流处理引擎(流式数据实时计算)
1. Apache Flink(当下实时计算标杆)
定位:原生流批一体计算引擎
核心特性:事件时间、状态管理、Exactly-Once 精准一次、窗口计算、CDC 实时入湖
场景:实时大屏、实时风控、实时数仓、实时推荐、日志实时清洗
2. Apache Spark Streaming / Structured Streaming
定位:Spark 实时流式模块
特点:微批处理,API 与 Spark SQL 统一,生态完善
局限:延迟秒级,低于 Flink 低延迟需求场景
3. Apache Storm
定位:初代低延迟流式框架
场景:极低延迟简单流计算,目前逐步被 Flink 替代
五、数据仓库 & OLAP 多维分析(查询加速、即席分析)
离线数仓
Apache Hive
基于 HDFS 的数据仓库,把 SQL 翻译成 Spark/Tez/MapReduce,标准离线数仓工具,支持分区、分桶。
实时数仓 / OLAP 分析引擎(海量数据秒级查询)
Apache Doris(百度开源,主流)
实时 OLAP,兼容 MySQL 协议,支持批量导入 + 实时流式写入,秒级多维分析,适合实时报表、大屏。
Apache StarRocks
基于 Doris 分支优化,向量化引擎更强,Join 性能突出,高并发查询场景首选。
ClickHouse(俄罗斯开源)
列式存储 OLAP,极致单节点性能,高吞吐写入,适合日志分析、时序数据。
Apache Presto / Trino(原 PrestoSQL)
交互式查询引擎,跨数据源联邦查询(Hive/Iceberg/MySQL/Doris),统一 SQL 查询多存储。
Apache Kylin
预计算 OLAP,多维 Cube 预聚合,亿级数据毫秒查询,传统 BI 报表场景。
六、消息中间件(数据流缓冲、解耦)
Apache Kafka
大数据实时链路必备,分布式高吞吐消息队列,采集工具、Flink/Spark、数仓之间的数据缓冲,支撑 CDC、实时流、日志传输。
备选:RabbitMQ(低吞吐、可靠业务消息,大数据场景少用)
七、任务调度平台(大数据任务定时运维)
Apache Airflow
Python 编写 DAG 工作流调度,生态最全,支持 Spark/Flink/Hive 任务,可视化运维。
DolphinScheduler(海豚调度,国内主流)
分布式可视化调度,简单易用,兼容大数据全组件,国产开源,运维友好。
Azkaban
Linkedin 开源,轻量调度,简单离线任务编排。
八、数据治理 & 元数据管理
Apache Atlas
大数据元数据、数据血缘、数据权限、数据分类治理,对接 Hive/Spark/Kafka。
Amundsen(Lyft 开源)
数据发现平台,数据字典、血缘、查询记录检索,适合数据开发自助查询。
DataHub(LinkedIn)
现代化元数据平台,CDC 实时同步元数据,支持数据质量、业务词典。
九、搜索引擎 & 日志检索
Elasticsearch + Kibana(ELK)
分布式全文检索引擎,海量日志存储、全文检索、多维日志分析;Kibana 配套可视化大屏。
十、机器学习 & 图计算
Spark MLlib:分布式机器学习算法库(分类、聚类、回归)
Apache Mahout:传统分布式机器学习框架
Apache GraphX:Spark 图计算(社交网络、关系图谱)
Apache Neo4j:图数据库,中小规模关系查询
TigerGraph:分布式大图数据库
十一、数据可视化工具
Apache Superset
轻量级 BI 可视化,对接 Hive/Doris/Trino/MySQL,拖拽报表、大屏,开源免费。
Metabase
简易自助 BI,上手门槛极低。
Grafana
时序数据可视化,监控指标、实时大屏(对接 Prometheus、InfluxDB)
行业常用组合方案参考
传统离线大数据平台
DataX/Sqoop → HDFS + Hive + Spark → Airflow/DolphinScheduler → Superset
实时数仓标准架构
MySQL → Debezium → Kafka → Flink → Hudi/Iceberg → Doris/StarRocks → 可视化大屏
日志分析平台
Filebeat/Flume → Kafka → Logstash → Elasticsearch + Kibana
轻量化数据湖(中小集群)
MinIO 对象存储 + Iceberg + Trino + Spark