Linear Regression

회귀분석이란

인과관계를 수학적으로 분석하는 것이다.

인과관계를 설명하고, 예측할 수 있다.

모델 성능의 척도

MSE (Mean Squared Error)

선형회귀에서 우리의 목적은 성공적인 예측을 위해, 현실을 잘 설명하는 모델을 만들어내는 데 있다. 따라서 우리는 오차를 최소화하는 것이 목표이다. 다음은 오차 제곱의 평균을 나타낸다. 오차는 이다. 이때, 는 모집단에서의 값을 의미한다. 하지만 데이터를 다룸에 있어서 모집단을 다룬다는 것은 불가능한 일이라 할 수 있으며, 실제로 우리가 계산할 수 있는 것은 표본집단에서의 값이다. 따라서 엄밀하게는 오차가 아닌 잔차를 계산한다고 말하는 것이 정확하다.

이며, 이를 충족시키는 a와 b의 값이 우리가 찾는 모델의 정체다.

이 문제를 풀기 위해 우리는 편미분과 선형대수 두가지의 방법으로 접근할 수 있다.

R

이 회귀모델이 주어진 데이터를 얼마나 잘 설명하는지에 대한 지표.

adjusted

기존의 R2값은 독립 변수의 개수, 가 커질 수록 증가하는 경향이 있었다. 이를 완화하기 위한 대안

MAPE (Mean Absolute Percentage Error)

기존의 MSE 또는 RMSE의 경우 절대적 Scale에 따라 그 값이 영향을 받는 다는 문제점이 있다. 이를 해결하기 위해, 실제 값 대비 오차의 비율들을 계산하여 평균을 내는 MAPE가 있다.

오버피팅 문제

모델의 성능을 높이기 위해 R2값을 늘리는 것에는 한계가 있다. 모델 학습은 모집단을 바탕으로 하는 것이 아니다. 표본집단을 바탕으로 한다. 따라서, 표본공간의 특성에 과하게 적응하는 오버피팅 문제가 발생할 수 있다. 오버피팅은 데이터 셋에서 학습할 필요가 없는 정도까지 학습함으로써 발생한다.

선형 회귀에서 오버피팅 문제를 해결하기 위한 접근에는 두가지가 있다.

-1. 독립 변수의 종류를 줄인다. 선형 회귀 식에서 불필요한 독립 변수를 제거한다. Feature Selection

-2. 계수의 가중치를 줄인다. 계수의 크기를 줄여 각각의 독립 변수의 영향력을 낮춘다. 정규화Regularization

Regularization

선형회귀 본질적 목적을 생각할 때, MSE를 낮추는 동시에 계수 값들을 줄이는 것이 모두 필요하다. 따라서 이 둘 사이에 절충안이 필요해지는데, 어떻게 절충을 할 것인가에서 정규화의 구체적인 실현 양상이 갈린다.

Lasso Regularization

각 계수의 절댓값들의 합을 이용해 정규화 라쏘 정규화는 변수 선택의 의미가 있다

Ridge Regularization

각 계수들의 제곱의 합을 이용해 정규화 릿지 정규화는 가중치 분배의 의미가 있다.

차원축소 문제

변수간의 상관성이 높을때 변수와 결과간에 상관성이 없을때

t-statistics

통계적 유의미성

degree of freedom

(계산의) 자유도에 대해 네이버 사전: 주어진 조건하에서 통계적 제한을 받지 않고 자유롭게 변화될 수 있는 요소의 수. 나무위키: 추정해야 할 미지수의 개수를 내가 가진 정보의 수에서 뺀 값.

p-value

vif

원본 링크


pearson 상관계수

2-2에 수강한 데이터처리와분석 수업에서 다루었었다.

Pearson correlation coefficient:

두 변수 사이의 선형관계를 나타내는 값으로, -1 ~ 1 사이의 값을 갖는다. +1에 가까움: 양적 선형 관계 -1 에 가까움: 음적 선형 관계 0에 가까움: 독립에 가까움. 이때, 거리 척도는 1/(1+거리)로 유사도로 변환한다.

원본 링크

spearman 상관계수

pearson 상관계수에서 사용하는 수치를 값 대신 순위로 판단한다.

Kendall 상관계수

spearman과 같이 두 변수 사이의 순서관계를 나타내는 값으로, -1 ~ 1 사이의 값을 갖는다. τ