数据集优化提升模型正确率完整方案
数据集质量往往比模型调参对最终正确率影响更大,优化分为:数据清洗、样本分布优化、特征优化、标注质量、数据增强、数据集划分、负样本 / 难例挖掘、噪声处理几个模块,下面给可落地实操方法。
一、数据清洗:去除脏数据(优先做)
1. 样本层面脏数据
错误样本:标签与内容完全不匹配(图片贴错标签、文本分类标错类别),直接删除或重新标注;少量错标会严重拉低精度。
重复样本:完全重复、高度近似样本。
训练集:去重,避免模型死记硬背,泛化变差;
验证 / 测试集:绝对不能和训练集重复,否则评估虚高。
无效样本:空白图片、乱码文本、全噪声无有效信息样本,直接剔除。
实操:文本用 simhash,图像用感知哈希 phash 做重复检测。
2. 标签噪声处理
低噪声:保留样本,做标签平滑;
高噪声(>15% 标签错误):人工复核,过滤;噪声太大模型会拟合错误标签,训练集涨点,测试集掉点。
工具思路:用模型预测训练集,预测结果和原始标签不一致的样本,导出人工审核,大概率是标错。

二、样本分布优化,解决类别不平衡
现象:某类别样本极多 / 极少,模型偏向多数类,少数类正确率极低
过采样:少数类复制样本(不推荐,容易过拟合);优先用数据增强生成新少数样本。
欠采样:多数类随机删除部分样本,会丢失信息,小数据集慎用。
加权策略(优先):不改动原始数据集,训练时设置
class_weight,给小类别更大 loss 权重。混合方案:对少类别做增强,多类别适度采样,尽量让各类别样本数量差距控制在1:5 以内。
注意:验证集、测试集严禁做采样、增强,必须保持真实业务分布,保证评估可靠。
三、难例挖掘:提升边界样本,最容易涨正确率
模型错分的样本就是难样本,是提升正确率的核心:
使用当前模型跑一遍训练集 / 业务真实数据,收集预测错误样本。
人工校验:
标注错误 → 修改标签;
样本本身模糊难区分 → 扩充同类难例样本;
将难例加入训练集,可以重复少量轮次,让模型重点学习边界。
工程做法:每一轮迭代导出 bad case,定期回流标注,是工业界提升精度最有效的手段。
四、数据集划分优化(很多人踩坑)
时间 / 业务划分,不要随机划分! 业务数据不要简单 shuffle 随机切分;如果是时序、线上真实场景,按时间切分:训练用历史,验证测试用后续时间段,避免数据泄露,防止测试集虚高。
比例参考:常规
训练70%,验证15%,测试15%;小数据集可以 8:1:1。测试集必须完全隔离:测试集样本绝对不能出现在训练、增强中,不能拿测试集调参。
分层划分:保证训练 / 验证 / 测试集各类别比例接近,避免验证集某类没有样本。
五、特征优化(表格 / NLP / 多模态)
表格数据
剔除无用特征:方差接近 0 常量特征、高度冗余强相关特征;
处理缺失值:区分随机缺失 / 业务缺失,不要无脑填 0;类别特征不要直接数字编码,使用 one‑hot/embedding;
异常值:业务合理保留,离群错误数据做截断 / 过滤。
NLP 文本数据集
清洗:去除乱码、特殊无用符号、html 标签;
长短分布:过长文本截断,过短无效文本过滤;
歧义样本:同文本多标签冲突样本人工处理。
图像数据集
剔除模糊、过曝、遮挡严重图片;
检查 bbox 标注漏标、偏移、框选错误。
六、数据增强:扩充有效多样性,提升泛化正确率
增强只用在训练集,val/test 禁止增强!
图像:翻转、裁剪、色彩抖动、随机擦除、MixUp/CutMix;避免过度增强生成现实不存在的样本。
NLP:同义词替换、回译、随机插入删除;不要把语义完全改变。
表格:SMOTE 合成少数样本,噪声注入。
⚠️ 不要盲目无限增强,增强后的样本要保证标签仍然正确;错误增强样本会引入噪声。
七、标注质量优化
制定清晰标注规范,减少标注人员主观歧义;很多正确率上不去根源是标注标准不统一。
抽样复核:每一批标注数据抽 10% 人工质检;
歧义样本单独评审,不要随便打标签。

八、诊断:怎么定位是数据集问题还是模型问题
训练集正确率很高,验证集很低 → 过拟合
原因:数据集太小、重复样本多、训练集和验证集分布不一致;优先扩充数据、增强,不要急着换大模型。
训练集正确率本身就低
大概率数据集噪声大、标签错、特征不足、类别混淆,优先清洗数据集。
训练、验证都不错,线上效果差
训练集和真实线上数据分布偏移(分布漂移),需要回流真实线上样本补充数据集。
九、实操优化执行顺序(建议按这个流程做,收益从高到低)
检查数据集划分,确认没有数据泄露
清洗:删除无效样本,修正错误标签、去重
统计类别分布,解决类别失衡
bad case 难例挖掘,回流补充难样本
训练集做适度数据增强
特征清洗筛选
最后再去调模型超参、换更大模型
简单示例检查清单
训练 / 验证 / 测试集无样本重叠泄露
重复样本已处理
错误标签、脏样本过滤完毕
各类别数量差异可控
bad‑case 难例样本回流
增强仅作用训练集
测试集分布和线上业务对齐
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢