章节目录 第319章 困死我了(2 / 2)

作品:《离语

体而言Y数据质量管理覆盖质量评估数据去噪数据监控数据探

查数据清洗数据诊断等方面Y而在这个过程中Y数据清洗是决定

数据质量好坏的重要因素。

数据清洗按照实现方式Y可以分为手工清洗和自动清洗

?

1?手工清洗X手工清洗是通过人工方式对数据进行检查Y发现数据中

的错误这种方式比较简单Y只要投入足够的人力物力财力Y也能

发现所有错误Y但效率低下在大数据量的情况下Y手工清洗数据几乎

是不可能的

?

2?自动清洗X自动清洗是通过专门编写的计算机应用程序来进行数据

清洗这种方法能解决某个特定的问题Y但不够灵活Y特别是在清理过

程需要反复进行时?一般来说,数据清理一遍就达到要求的很少?Y程序

复杂Y清理过程变化时工作量大而且Y这种方法也没有充分利用目前

数据库提供的强大的数据处理能力。

数据清洗主要是对缺失值重复值异常值和数据类型有误的数据

进行处理Y数据清洗的内容主要包括四点

?

1?缺失值处理由于调查编码和录入误差Y数据中可能存在

一些缺失值Y需要给予适当的处理常用的处理方法有X估算

整例删除变量删除和成对删除

?

2?异常值处理根据每个变量的合理取值范围和相互关系Y检

查数据是否合乎要求Y发现超出正常范围逻辑上不合理或者相

互矛盾的数据。

数据清洗主要是对缺失值重复值异常值和数据类型有误的数据

进行处理Y数据清洗的内容主要包括四点

?

3?数据类型转换数据类型往往会影响到后续的数据处理分析

环节Y因此Y需要明确每个字段的数据类型Y比如Y来自A表的

学号是字符型Y而来自B表的字段是日期型Y在数据清洗的时候

就需要对二者的数据类型进行统一处理