按开源免费、商业工具、数据库内置、Python/Java 开发组件、数据质量规则引擎分类,覆盖探查、校验、清洗、监控、血缘、问题报告,全部是生产落地常用工具,标注核心能力、适用场景、优缺点。
一、开源免费工具(企业 / 项目优先选型)
1. Great Expectations(GE)
核心能力:数据质量校验框架,定义 Expectation 规则,支持批流数据,输出质量报告,对接 Airflow 调度,支持 CSV、Parquet、MySQL、Hive、Spark、BigQuery。
典型用途:ETL 流水线嵌入数据校验,数据入库前拦截脏数据,生成质量报告。
优点:规则丰富,可自定义规则,与数据流水线深度集成;
缺点:配置较繁琐,UI 能力偏弱,需要代码编写。
语言:Python
2. DataHub
核心能力:元数据管理 + 数据质量监控 + 数据血缘,支持质量规则配置、质量告警、脏数据统计。
典型用途:数据中台一体化,元数据、血缘、质量、资产盘点一体化。
优点:完整数据资产平台,开源,UI 完善;
缺点:部署重,资源消耗大。
3. Amundsen
核心能力:元数据平台,可集成 Great Expectations 做质量展示,侧重数据发现、血缘。
典型用途:数据地图,查看表质量评分。
4. Deequ(AWS 开源)
核心能力:基于 Spark 的数据质量库,完整性、唯一性、重复值、格式、值域校验,支持批处理大规模数据。
典型用途:大数据 Spark 作业内做数据质量,数仓离线数据质量检测。
语言:Scala/Java,Spark 原生。
优点:大数据量性能优秀;
缺点:无独立 UI,需要自己做报表。
5. OpenDQ
核心能力:开源数据质量引擎,支持数据库直接校验,内置大量质量规则(空值、重复、格式、业务规则)。
适用:关系型数据库数据质量探查校验。
6. Apache Griffin(Apache 顶级项目)
核心能力:大数据数据质量,支持 Hive、HBase、Kafka 流数据;维度:完整性、准确性、唯一性、一致性、时效性;支持告警。
典型场景:大数据平台、数仓离线 + 准实时质量监控。
优点:大数据生态原生;
缺点:社区活跃度下降,部署复杂。

二、Python 开发组件(轻量、代码化清洗探查)
1. Pandas‑Profiling(ydata‑profiling)
能力:一键生成数据探查报告,缺失值、重复、分布、异常值,HTML 可视化报告。
场景:数据集前期探查,分析脏数据现状;小 / 中规模数据集。
新版本包名:
ydata‑profiling
2. Great‑Tables
质量结果可视化输出,输出质量校验报表。
3. PyJanitor
Pandas 扩展库,封装常用清洗:去重、空值处理、格式标准化、列清洗。
三、Java / Spark 组件(Java、大数据生产)
Deequ:Spark 数据质量,Java/Scala API,适合数仓离线任务。
Apache Spark MLlib:异常检测,离群点识别。
四、数据库 & 数仓内置能力(零额外部署,优先使用)
Postgres / MySQL CHECK 约束:值域、格式校验,入库拦截脏数据。
Doris / ClickHouse:自定义函数 + 物化视图,统计空值率、重复率,做质量指标。
Hive:UDF 自定义校验函数,定期 SQL 统计质量指标。
OceanBase / 达梦:约束、触发器、定时任务统计质量指标。
小技巧:很多场景不需要重型工具,定时 SQL 计算质量指标(空值率、重复率、记录数波动)写入质量结果表,配合告警即可完成基础数据质量。
五、商业成熟工具(企业级,开箱即用)
1. Informatica Data Quality
老牌商业数据质量,探查、清洗、标准化、去重、地址标准化;支持多数据源。 适用大型企业数据治理项目。
2. Talend Data Quality
ETL 一体化,内置质量模块,探查、校验、清洗。
3. Collibra
数据治理平台,元数据 + 数据质量 + 数据资产。
4. Alation
数据目录 + 数据质量评分。
5. 国内:帆软 FineDataLink、华为 DAYU、阿里 DataWorks 数据质量模块
DataWorks 数据质量:内置规则模板,阈值告警,调度联动,脏数据拦截,云上数仓首选。
华为 DAYU:数据治理全套,质量监控、规则库、质量报告,适配国产化鲲鹏 / 高斯。
FineDataLink:低代码,国内中小企业,可视化配置质量规则。
六、流数据质量工具(实时数据、Kafka 链路)
Great Expectations + Kafka:做流批一体校验
Apache Flink 自定义 UDF:实时校验脏数据,脏数据分流输出死信 Topic。
Deequ‑streaming:Spark Streaming 质量校验。

七、选型建议(落地参考)
八、常用数据质量 5 大维度对应工具能力
完整性:空值统计、必填字段校验
唯一性:主键 / 业务键重复检测
准确性:值域校验、格式校验、参照完整性
一致性:跨表、跨库数据比对
时效性:数据延迟、数据更新时间监控
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢