适用于离线数仓、实时计算、数据湖、企业数据中台、政务 / 制造业 / 互联网大数据项目,分为业务需求、技术能力、运维成本、生态兼容、安全合规、商业化支撑六大维度,可直接用于方案评审、招标打分。
一、业务场景匹配(首要标准)
选型先对齐业务,避免技术过度堆砌
数据接入类型
结构化数据库、日志、IoT 时序数据、音视频、非结构化文件(文档 / 图片);是否需要 CDC 数据库同步。
计算模式需求
离线批处理:T+1 报表、数据仓库
实时流计算:实时大屏、实时风控、实时指标
交互式查询:自助 BI、Ad-Hoc 即席查询
OLAP 多维分析:多维报表、多维钻取
AI / 机器学习:特征工程、模型训练
数据规模指标(量化关键)
日接入数据量、存储总量、峰值 TPS
数据保存周期、冷热数据分层诉求
SLA 要求
任务延迟容忍度、故障恢复时长、是否需要 7×24 不间断运行。
二、核心技术能力指标
1. 存储架构
数据仓库架构(Hive 类):适合结构化、强规范指标;
数据湖架构(Iceberg/Hudi/Delta Lake):兼容多格式,灵活接纳半结构化数据;
湖仓一体:同时支持实时写入、离线分析、ACID 事务;
关注点:支持文件格式(Parquet/ORC)、Schema 演进、ACID、冷热分层存储、对象存储兼容(MinIO、OSS、S3)。
2. 计算引擎支持
平台原生支持引擎:Spark、Flink、Hive、Trino (Presto)、Doris、ClickHouse 等;
重点考察:资源调度效率、大任务稳定性、内存管控、数据倾斜优化能力。
3. 查询性能
Ad-Hoc 查询响应时间、并发查询支持数;海量数据聚合、关联查询耗时;是否支持索引、物化视图。
4. 资源调度
Yarn / K8s 两种主流底座支持情况;
弹性扩缩容:闲时释放资源、峰值自动扩容,直接决定云环境成本。
5. 数据时效性
批处理最小调度粒度;实时链路端到端延迟(毫秒 / 秒级);能否支持增量更新、CDC 实时入湖。
三、生态兼容性与开放性
数据源兼容
MySQL、PostgreSQL、Oracle、Kafka、Redis、ES、FTP、对象存储、IoT 设备时序库。
下游输出生态
BI 工具(FineBI、Superset、Tableau)、API 服务、数据库、机器学习框架。
标准兼容性
是否兼容 SQL 标准;是否开放 API、Rest 接口;
避免封闭私有协议、私有存储格式,防止厂商锁定。
部署底座
支持裸金属、虚拟机、Docker、Kubernetes;本地化部署、私有云、公有云混合部署。
四、运维与易用性标准(长期成本关键)
部署复杂度
一键部署、容器化部署;组件依赖是否繁杂(传统 Hadoop 组件多,运维负担高)。
监控告警体系
任务监控、资源监控、数据监控(数据质量、数据延迟、数据缺失告警);日志检索、故障诊断面板。
工作流调度
自带调度平台(DolphinScheduler/Airflow)、任务依赖、失败重试、重跑、血缘追溯。
数据治理内置能力
数据血缘、元数据管理、数据地图、标签管理、数据生命周期管理。
运维人力成本
传统 Hadoop 全家桶运维门槛高;轻量化湖仓平台(Doris、StarRocks、ByteHouse)运维成本更低。
五、安全与合规
政企项目硬性门槛
权限体系:RBAC 细粒度权限、行列权限、数据脱敏;
审计日志:访问审计、任务操作审计;
数据加密:传输加密、存储加密;
国产化适配:鲲鹏、飞腾、统信、麒麟;信创适配认证;
合规要求:等保 2.0、数据安全法、个人隐私保护要求。
六、成本与商业化支撑
许可模式
纯开源:无软件授权费,但需要自建运维;
商业发行版(CDP、EMR、火山 EMR、阿里云 MaxCompute):订阅制,含技术支持;
SaaS 云原生大数据平台:按量付费,无需自建集群。
总体拥有成本 TCO
硬件服务器、存储、人力运维、技术服务费;关注存储压缩效率(直接影响磁盘开支)。
技术服务能力
厂商响应时效、本地技术团队、BUG 修复速度、版本持续迭代;
社区活跃度(开源方案重点看)
Github 更新频率、issue 响应、文档完善程度、从业人员人才储备。
七、额外避坑选型要点
避免过度选型:几十 TB 小规模场景,不必上完整 Hadoop 集群,优先轻量化 OLAP 湖仓;
人才匹配:团队熟悉 Spark/Flink,优先选对应生态平台;不要选择极其小众框架,招人困难;
迁移成本:历史数据迁移难度、SQL 是否需要大量改写;
扩展性上限:集群横向扩容是否无瓶颈,能否支撑未来 3~5 年业务增长。
快速选型简易参考(场景对照)
传统企业离线数仓、海量历史数据:CDP/Hadoop + Hive + Spark
实时指标、实时大屏、湖仓一体:Flink + Iceberg + StarRocks/Doris
云上业务,不想运维集群:公有云 Serverless 大数据(MaxCompute、EMR Serverless)
轻量自助 BI、交互式分析、中小体量:ClickHouse / StarRocks
信创国产化项目:优先选择完成国产软硬件适配的商业发行版