易君召
发布于 2026-09-02 / 作者:易君召 / 9 阅读
0

数据质量提升实用工具清单

开源免费、商业工具、数据库内置、Python/Java 开发组件、数据质量规则引擎分类,覆盖探查、校验、清洗、监控、血缘、问题报告,全部是生产落地常用工具,标注核心能力、适用场景、优缺点。

一、开源免费工具(企业 / 项目优先选型)

1. Great Expectations(GE)

  • 核心能力:数据质量校验框架,定义 Expectation 规则,支持批流数据,输出质量报告,对接 Airflow 调度,支持 CSV、Parquet、MySQL、Hive、Spark、BigQuery。

  • 典型用途:ETL 流水线嵌入数据校验,数据入库前拦截脏数据,生成质量报告。

  • 优点:规则丰富,可自定义规则,与数据流水线深度集成;

  • 缺点:配置较繁琐,UI 能力偏弱,需要代码编写。

  • 语言:Python

2. DataHub

  • 核心能力:元数据管理 + 数据质量监控 + 数据血缘,支持质量规则配置、质量告警、脏数据统计。

  • 典型用途:数据中台一体化,元数据、血缘、质量、资产盘点一体化。

  • 优点:完整数据资产平台,开源,UI 完善;

  • 缺点:部署重,资源消耗大。

3. Amundsen

  • 核心能力:元数据平台,可集成 Great Expectations 做质量展示,侧重数据发现、血缘。

  • 典型用途:数据地图,查看表质量评分。

4. Deequ(AWS 开源)

  • 核心能力:基于 Spark 的数据质量库,完整性、唯一性、重复值、格式、值域校验,支持批处理大规模数据。

  • 典型用途:大数据 Spark 作业内做数据质量,数仓离线数据质量检测。

  • 语言:Scala/Java,Spark 原生。

  • 优点:大数据量性能优秀;

  • 缺点:无独立 UI,需要自己做报表。

5. OpenDQ

  • 核心能力:开源数据质量引擎,支持数据库直接校验,内置大量质量规则(空值、重复、格式、业务规则)。

  • 适用:关系型数据库数据质量探查校验。

6. Apache Griffin(Apache 顶级项目)

  • 核心能力:大数据数据质量,支持 Hive、HBase、Kafka 流数据;维度:完整性、准确性、唯一性、一致性、时效性;支持告警。

  • 典型场景:大数据平台、数仓离线 + 准实时质量监控。

  • 优点:大数据生态原生;

  • 缺点:社区活跃度下降,部署复杂。

二、Python 开发组件(轻量、代码化清洗探查)

1. Pandas‑Profiling(ydata‑profiling)

  • 能力:一键生成数据探查报告,缺失值、重复、分布、异常值,HTML 可视化报告。

  • 场景:数据集前期探查,分析脏数据现状;小 / 中规模数据集。

新版本包名:ydata‑profiling

2. Great‑Tables

  • 质量结果可视化输出,输出质量校验报表。

3. PyJanitor

  • Pandas 扩展库,封装常用清洗:去重、空值处理、格式标准化、列清洗。

三、Java / Spark 组件(Java、大数据生产)

  1. Deequ:Spark 数据质量,Java/Scala API,适合数仓离线任务。

  2. Apache Spark MLlib:异常检测,离群点识别。

四、数据库 & 数仓内置能力(零额外部署,优先使用)

  1. Postgres / MySQL CHECK 约束:值域、格式校验,入库拦截脏数据。

  2. Doris / ClickHouse:自定义函数 + 物化视图,统计空值率、重复率,做质量指标。

  3. Hive:UDF 自定义校验函数,定期 SQL 统计质量指标。

  4. OceanBase / 达梦:约束、触发器、定时任务统计质量指标。

小技巧:很多场景不需要重型工具,定时 SQL 计算质量指标(空值率、重复率、记录数波动)写入质量结果表,配合告警即可完成基础数据质量。

五、商业成熟工具(企业级,开箱即用)

1. Informatica Data Quality

  • 老牌商业数据质量,探查、清洗、标准化、去重、地址标准化;支持多数据源。 适用大型企业数据治理项目。

2. Talend Data Quality

ETL 一体化,内置质量模块,探查、校验、清洗。

3. Collibra

数据治理平台,元数据 + 数据质量 + 数据资产。

4. Alation

数据目录 + 数据质量评分。

5. 国内:帆软 FineDataLink、华为 DAYU、阿里 DataWorks 数据质量模块

  • DataWorks 数据质量:内置规则模板,阈值告警,调度联动,脏数据拦截,云上数仓首选。

  • 华为 DAYU:数据治理全套,质量监控、规则库、质量报告,适配国产化鲲鹏 / 高斯。

  • FineDataLink:低代码,国内中小企业,可视化配置质量规则。

六、流数据质量工具(实时数据、Kafka 链路)

  1. Great Expectations + Kafka:做流批一体校验

  2. Apache Flink 自定义 UDF:实时校验脏数据,脏数据分流输出死信 Topic。

  3. Deequ‑streaming:Spark Streaming 质量校验。

七、选型建议(落地参考)

场景

推荐工具

小数据集,前期脏数据探查

ydata‑profiling

Python ETL 流水线嵌入质量校验

Great Expectations

Spark 大数据离线数仓质量

Deequ / Apache Griffin

想要完整元数据 + 血缘 + 质量开源平台

DataHub

云上数仓快速落地,不想维护开源组件

DataWorks 数据质量

国产化信创环境

华为 DAYU、FineDataLink

轻量方案:不想部署新服务

SQL 定时统计质量指标 + 告警

八、常用数据质量 5 大维度对应工具能力

  1. 完整性:空值统计、必填字段校验

  2. 唯一性:主键 / 业务键重复检测

  3. 准确性:值域校验、格式校验、参照完整性

  4. 一致性:跨表、跨库数据比对

  5. 时效性:数据延迟、数据更新时间监控


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/data-quality-improvement-tools-guide

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/