통계의 기본단위인 평균, 분산, 표준편차에 대한 정리

평균(mean)

  • 모든 수의 합을 개수로 나눈 값으로, 대표값 중 하나로 집단의 전반적인 경향을 파악하는데 사용
  • 평균 = (모든 데이터 값의 합) / (데이터 개수)

편차(deviation)

  • 각 데이터 값의 평균과의 차이
  • 모든 데이터 값의 편차를 더하면 항상 0이 됨
  • 편차 = (각 데이터 값) - (평균)

분산(variance)

  • 데이터들이 평균을 기준으로 얼마나 퍼져 있는가를 나타냄
  • 분산이 크면 데이터가 불규칙하다는 의미(평균과 거리가 대체로 멀다는 의미)
  • 분산 = (편차 제곱들의 합) / (평균)

표준편차(standard deviation)

  • 분산의 양의 제곱근으로, 분산은 제곱으로 인해 수치가 커지므로 제곱근을 취해 적당히 줄인 값

표현


Normalization

평균과 표준편차를 이용한 Normalization (Standardization)

  • 데이터의 평균을 0으로, 표준편차를 1로 조정하여 데이터 분포를 표준 정규 분포와 유사하게 만드는 방법이다.
  • 이를 통해 데이터의 스케일을 통일하고, 이상치(Outlier)의 영향을 줄이며, 모델 학습 시 안정성과 수렴 속도를 향상시킬 수 있다.
  • : 데이터의 번째 값
  • : 데어터의 평균
  • : 데이터의 표준편차

참고