第287章 衣裙(3 / 5)

离语 semaphore 2051 字 2024-11-08

进行处理Y数据清洗的内容主要包括四点

??0??5

1??0??6缺失值处理由于调查编码和录入误差Y数据中可能存在

一些缺失值Y需要给予适当的处理常用的处理方法有X估算

整例删除变量删除和成对删除

??0??5

2??0??6异常值处理根据每个变量的合理取值范围和相互关系Y检

查数据是否合乎要求Y发现超出正常范围逻辑上不合理或者相

互矛盾的数据。

数据清洗主要是对缺失值重复值异常值和数据类型有误的数据

进行处理Y数据清洗的内容主要包括四点

??0??5

3??0??6数据类型转换数据类型往往会影响到后续的数据处理分析

环节Y因此Y需要明确每个字段的数据类型Y比如Y来自A表的

学号是字符型Y而来自B表的字段是日期型Y在数据清洗的时候

就需要对二者的数据类型进行统一处理

??0??5

4??0??6重复值处理重复值的存在会影响数据分析和挖掘结果的准

确性Y所以Y在数据分析和建模之前需要进行数据重复性检验Y

如果存在重复值Y还需要进行重复值的删除。

在进行数据清洗时Y需要注意如下事项X

??0??5

1??0??6数据清洗时优先进行缺失值异常值和数据类型转换的操作Y最后进

行重复值的处理

site stats