易君召
发布于 2026-08-25 / 作者:易君召 / 2 阅读
0

数据集优化提升模型正确率完整方案

#AI

数据集优化提升模型正确率完整方案

数据集质量往往比模型调参对最终正确率影响更大,优化分为:数据清洗、样本分布优化、特征优化、标注质量、数据增强、数据集划分、负样本 / 难例挖掘、噪声处理几个模块,下面给可落地实操方法。

一、数据清洗:去除脏数据(优先做)

1. 样本层面脏数据

  1. 错误样本:标签与内容完全不匹配(图片贴错标签、文本分类标错类别),直接删除或重新标注;少量错标会严重拉低精度。

  2. 重复样本:完全重复、高度近似样本。

    • 训练集:去重,避免模型死记硬背,泛化变差;

    • 验证 / 测试集:绝对不能和训练集重复,否则评估虚高。

  3. 无效样本:空白图片、乱码文本、全噪声无有效信息样本,直接剔除。

实操:文本用 simhash,图像用感知哈希 phash 做重复检测。

2. 标签噪声处理

  • 低噪声:保留样本,做标签平滑;

  • 高噪声(>15% 标签错误):人工复核,过滤;噪声太大模型会拟合错误标签,训练集涨点,测试集掉点。

  • 工具思路:用模型预测训练集,预测结果和原始标签不一致的样本,导出人工审核,大概率是标错。

二、样本分布优化,解决类别不平衡

现象:某类别样本极多 / 极少,模型偏向多数类,少数类正确率极低

  1. 过采样:少数类复制样本(不推荐,容易过拟合);优先用数据增强生成新少数样本。

  2. 欠采样:多数类随机删除部分样本,会丢失信息,小数据集慎用。

  3. 加权策略(优先):不改动原始数据集,训练时设置class_weight,给小类别更大 loss 权重。

  4. 混合方案:对少类别做增强,多类别适度采样,尽量让各类别样本数量差距控制在1:5 以内

注意:验证集、测试集严禁做采样、增强,必须保持真实业务分布,保证评估可靠。

三、难例挖掘:提升边界样本,最容易涨正确率

模型错分的样本就是难样本,是提升正确率的核心:

  1. 使用当前模型跑一遍训练集 / 业务真实数据,收集预测错误样本。

  2. 人工校验:

    • 标注错误 → 修改标签;

    • 样本本身模糊难区分 → 扩充同类难例样本;

  3. 将难例加入训练集,可以重复少量轮次,让模型重点学习边界。

工程做法:每一轮迭代导出 bad case,定期回流标注,是工业界提升精度最有效的手段。

四、数据集划分优化(很多人踩坑)

  1. 时间 / 业务划分,不要随机划分! 业务数据不要简单 shuffle 随机切分;如果是时序、线上真实场景,按时间切分:训练用历史,验证测试用后续时间段,避免数据泄露,防止测试集虚高。

  2. 比例参考:常规 训练70%,验证15%,测试15%;小数据集可以 8:1:1。

  3. 测试集必须完全隔离:测试集样本绝对不能出现在训练、增强中,不能拿测试集调参。

  4. 分层划分:保证训练 / 验证 / 测试集各类别比例接近,避免验证集某类没有样本。

五、特征优化(表格 / NLP / 多模态)

表格数据

  1. 剔除无用特征:方差接近 0 常量特征、高度冗余强相关特征;

  2. 处理缺失值:区分随机缺失 / 业务缺失,不要无脑填 0;类别特征不要直接数字编码,使用 one‑hot/embedding;

  3. 异常值:业务合理保留,离群错误数据做截断 / 过滤。

NLP 文本数据集

  1. 清洗:去除乱码、特殊无用符号、html 标签;

  2. 长短分布:过长文本截断,过短无效文本过滤;

  3. 歧义样本:同文本多标签冲突样本人工处理。

图像数据集

  1. 剔除模糊、过曝、遮挡严重图片;

  2. 检查 bbox 标注漏标、偏移、框选错误。

六、数据增强:扩充有效多样性,提升泛化正确率

增强只用在训练集,val/test 禁止增强!

  • 图像:翻转、裁剪、色彩抖动、随机擦除、MixUp/CutMix;避免过度增强生成现实不存在的样本。

  • NLP:同义词替换、回译、随机插入删除;不要把语义完全改变。

  • 表格:SMOTE 合成少数样本,噪声注入。

⚠️ 不要盲目无限增强,增强后的样本要保证标签仍然正确;错误增强样本会引入噪声。

七、标注质量优化

  1. 制定清晰标注规范,减少标注人员主观歧义;很多正确率上不去根源是标注标准不统一。

  2. 抽样复核:每一批标注数据抽 10% 人工质检;

  3. 歧义样本单独评审,不要随便打标签。

八、诊断:怎么定位是数据集问题还是模型问题

  1. 训练集正确率很高,验证集很低 → 过拟合

    • 原因:数据集太小、重复样本多、训练集和验证集分布不一致;优先扩充数据、增强,不要急着换大模型。

  2. 训练集正确率本身就低

    • 大概率数据集噪声大、标签错、特征不足、类别混淆,优先清洗数据集。

  3. 训练、验证都不错,线上效果差

    • 训练集和真实线上数据分布偏移(分布漂移),需要回流真实线上样本补充数据集。

九、实操优化执行顺序(建议按这个流程做,收益从高到低)

  1. 检查数据集划分,确认没有数据泄露

  2. 清洗:删除无效样本,修正错误标签、去重

  3. 统计类别分布,解决类别失衡

  4. bad case 难例挖掘,回流补充难样本

  5. 训练集做适度数据增强

  6. 特征清洗筛选

  7. 最后再去调模型超参、换更大模型

简单示例检查清单

  • 训练 / 验证 / 测试集无样本重叠泄露

  • 重复样本已处理

  • 错误标签、脏样本过滤完毕

  • 各类别数量差异可控

  • bad‑case 难例样本回流

  • 增强仅作用训练集

  • 测试集分布和线上业务对齐


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/dataset-optimization-improve-model-accuracy-guide

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/