通常,我们倾向于在构建模型时忽略异常值,这不是一个明智的做法, 异常值使数据偏移并降低准确性,在此让我们进一步了解异常处理。
最近我们被客户要求撰写关于异常处理的研究报告,包括一些图形和统计输出。
异常值是分析师和数据科学家常用的术语,因为它需要密切注意,否则可能导致错误的估计。 简单来说,异常值是一个观察值,远远超出了样本中的整体模式。
我们举个例子,做客户分析,发现客户的年平均收入是80万美元。 但是,有两个客户的年收入是4美元和420万美元。 这两个客户的年收入明显不同于其他人,那这两个观察结果将被视为异常值。
异常值有两种类型:单变量和多变量。 以上,我们讨论了单变量异常值的例子。 当我们看到单变量的分布时,可以找到这些异常值。 多变量异常值是n维空间中的异常值,必须通过多维度的分布。

Outlier_21.png
让我们以一个例子来理解这一点。 例如身高和体重之间的关系,我们对“身高”和“体重”有单变量和双变量分布。 看box plot,没有任何异常值(高于和低于1.5 * IQR,最常见的方法)。 现在看scatter plot,有两个值在一个特定的重量和身高的平均值以下