Transclude of Machine-Learning-Algorithm.#의사결정트리decision-binary-tree-tree
결국 의사결정트리는 불순도가 낮아지는 방향으로 주어진 데이터를 분류하는 분석 방법이다. 이때, 어떤 불순도 지표를 선택하는지, 어떻게 분류할지에 따라 의사결정트리의 생성 방식이 다르다. -1. CART: Classification And Regression Tree -2. CHAID: Chi-squared Automatic Interaction Detection
CART 분류 트리
지니 계수에 기초하여 의사결정트리를 생성한다. 어떤 레이블을 이용한 분류가 불순도를 가장 많이 낮추는지 분석한다.
이때, 각 레이블이 불순도를 낮추는 정도는 자식들의 불순도의 가중평균이 말해준다.
의사결정트리 with 회귀분석
결과값이 이분 레이블이 아닌, 요금 등과 같은 연속적인 수치 레이블일 경우에 사용할 수 있다. 이분 레이블에서는 지니 계수를 이용하여 구분했지만, 이때는 표준편차를 이용한다.
레이블의 분류에 따라 표준편차를 각각 구한 후, 가중 지니 계수 대신 가중 표준편차를 구하여 불순도를 계산한다.
분류의 평가
Accuracy
전체 데이터 대비, 정확히 예측한 비율
Recall vs Precision
실제값과 예측값간의 예측성공 비율을 비교
-Recall: 실제 Positive 데이터 중, 옳게 예측한 비율 -Precision: 예측 Positive 데이터 중, 옳게 예측한 비율
Sensitivity vs Specificity
실제값들간의 예측 성공 비율 비교
-Sensitivity: 실제 Positive 데이터 중, 옳게 예측한 비율 -Specificity: 실제 Negative 데이터 중, 옳게 예측한 비율