开源数据质量与置信学习库,自动发现标注错误、噪声标签与脏数据。
Project story
Cleanlab 实现置信学习(Confident Learning):仅用模型预测与原始标签,就能自动识别标注错误、估计噪声标签比例并修正,是提升数据集质量的关键工具。
支持分类、文本、图像与多标签场景,提供 Find Label Issues、Datalab 等开箱 API,可与任意模型训练流程配合。
适合场景:训练数据清洗、标注质量审计、提升模型上界准确率。
上手方式:pip install cleanlab,传入预测概率与标签即可定位疑似错误样本。