DQI (Data Quality Index, 데이터 품질 지표)
일관성 - 표준 오류율
개체의 속성이 표준을 준수하고 있는가? ex) 010-0000-0000 이나 010 0000 0000 은 속성이 다르다.
완전성 - 구조 오류율
데이터 베이스의 논리적 설계 및 물리적 구조가 올바른가?
정확성 - 값 오류율
데이터가 유효한 범위로 구성되어 있는가? ex) 13월 1일 ← 정확도 위배
그외: 준비성, 보안성, 적시성, 유용성
품질 오류율
- 표준 오류율: 항목 별 오류율의 산술평균
- 구조 오류율: 항목 별 오류율의 산술평균
- 값 오류율: 항목별 오류 데이터 건수의 합이 가지는 비율
이상치
이상치를 분류하는 기준은 무엇인가?
IQR (Interquartile Range, = Q3 - Q1)
주어진 데이터의 절반이 IQR 범위 내에 분포함.
Box-and-Whisker 도식

Tukey’s Fences
Q1, Q3으로부터 1.5IQR을 초과하는 값은 이상치로 간주
Carling’s Modification
Median과 차이가 2.3IQR을 초과하는 값은 이상치로 간주
3-sigma Rule
평균과 3
결측치
결측치의 종류
MCAR (Missing Completely At Random)
특정 변수와 관계없이 무작위로 발생한 결측치
MAR (Missing At Random)
다른 변수와 연관되어 발생한 결측치 ex) 여성들이 남성에 비해 몸무게 비공개를 많이 한 경우
MNAR (Missing Not At Random)
변수 스스로와 연관되어 발생한 결측치 ex) 브론즈가 다른 티어에 비해 티어 비공개를 많이 한 경우
삭제를 통한 대응
Column Drop
결측치가 일정 비율 이상인 열을 제거 → 변수에 대한 정보 오염이 심하다는 뜻
Listwise Deletion
결측치가 하나라도 존재하는 행을 제거 → 해당 데이터를 사용하지 않겠다는 뜻
Pairwise Deletion
분석 모델에 투입되는 열들에 대해 결측치가 하나라도 존재하는 행을 제거 → 리스트와이즈와 똑같은데, 필요한것만 지우겠단 뜻
대체를 통한 대응
대푯값을 이용한 대체
Column 값의 평균 또는 최빈값으로 대체 → 다른 변수들의 값을 고려하지 않는다는 한계점 존재
k-NN을 이용한 대체
가장 가까운 k개의 이웃의 산술평균 또는 가중평균 값으로 대체