Computer >> 컴퓨터 >  >> 소프트웨어 >> Office

엑셀(EXCEL)에서 분산 계산하는 방법 완벽 가이드

엑셀로 분산을 계산해야 하는데, 분산이 정확히 무엇을 의미하는지 또는 어떻게 계산해야 할지 막막하신가요? 걱정하지 마세요. 분산은 개념 자체도 간단하고 계산 과정도 더욱 쉽습니다. 이 글만 끝까지 읽으면 금세 분산 계산 전문가가 되실 수 있습니다.

분산이란 무엇인가?

'분산(Variance)'은 데이터가 평균으로부터 얼마나 떨어져 있는지를 평균적으로 측정하는 통계 지표입니다. 여기서 '평균(mean)'이란 데이터셋에 포함된 모든 값을 더한 뒤 값의 개수로 나눈 것을 말합니다. 분산을 알면 해당 데이터셋의 값들이 평균 주변에 고르게 모여 있는지, 아니면 사방으로 흩어져 있는지 파악할 수 있습니다.

수학적으로 분산은 생각보다 복잡하지 않습니다. 다음 순서대로 계산합니다.

  1. 데이터셋의 평균을 구합니다. 모든 값을 더한 후 값의 개수로 나누면 됩니다.
  2. 데이터셋의 각 값에서 평균을 뺍니다.
  3. 나온 결과값들을 모두 제곱합니다(음수를 없애기 위함입니다).
  4. 제곱한 값들을 모두 더합니다.
  5. 제곱값들의 평균을 구하면 그것이 바로 분산입니다.

보시다시피 계산 자체는 어렵지 않습니다. 하지만 값이 수백, 수천 개라면 손으로 일일이 계산하기엔 시간이 너무 오래 걸리겠죠. 다행히 엑셀은 이 과정을 자동화할 수 있습니다!

분산은 어디에 활용할까?

분산은 그 자체로 다양하게 활용됩니다. 통계적인 관점에서는 데이터가 얼마나 퍼져 있는지를 간결하게 보여주는 지표 역할을 하며, 투자자들은 특정 투자의 위험도를 추정하는 데 분산을 사용합니다.

예를 들어 일정 기간 동안의 주가 데이터를 모아 분산을 계산하면, 해당 종목이 과거에 얼마나 변동성이 컸는지 파악할 수 있습니다. '과거가 미래를 예측한다'는 전제下에서라면, 분산이 낮은 자산일수록 안전하고 예측 가능한 투자라고 볼 수 있는 것이죠.

엑셀(EXCEL)에서 분산 계산하는 방법 완벽 가이드

또한 서로 다른 시기의 분산 값을 비교할 수도 있습니다. 이렇게 하면 눈에 보이지 않는 숨은 변수가 데이터에 영향을 미치면서 분산을 변화시키는 시점을 발견하는 데 도움이 됩니다.

분산은 '표준편차(Standard Deviation)'라는 통계량과도 밀접한 관련이 있습니다. 분산을 계산할 때 값들을 제곱한다는 점을 기억하세요. 즉, 분산은 원래 데이터와 같은 단위로 표현되지 않습니다. 표준편차는 분산의 제곱근을 구해 값을 원래 단위로 되돌린 것입니다. 따라서 데이터가 킬로그램(kg) 단위였다면 표준편차 역시 kg 단위로 표현됩니다.

모분산과 표본 분산, 무엇을 선택해야 할까?

엑셀에는 수식이 약간씩 다른 두 가지 유형의 분산이 있습니다. 어떤 것을 선택할지는 데이터의 성격에 달려 있습니다. 데이터가 대상 집단 전체, 즉 '모집단(population)'을 모두 포함한다면 모분산을 사용해야 합니다. 여기서 모집단이란 대상 집단에 속한 모든 구성원의 값을 하나도 빠짐없이 가지고 있다는 의미입니다.

엑셀(EXCEL)에서 분산 계산하는 방법 완벽 가이드

예를 들어 왼손잡이의 몸무게를 조사한다고 해봅시다. 모집단은 지구상의 모든 왼손잡이 개인이며, 만약 그들 전원의 몸무게를 측정했다면 모분산을 사용하면 됩니다.

물론 현실에서는 큰 모집단에서 추출한 작은 표본(sample)으로 만족하는 경우가 대부분입니다. 이럴 때는 표본 분산을 사용합니다. 다만 모집단 규모가 작다면 모분산이 여전히 실용적입니다. 예컨대 한 회사에 직원이 수백~수천 명 있고 모든 직원의 데이터를 보유하고 있다면, 이들은 통계학적 의미에서 하나의 '모집단'이라고 볼 수 있습니다.

올바른 분산 수식 고르기

엑셀에는 표본 분산 수식 세 개와 모분산 수식 세 개가 있습니다.

  • VAR, VAR.S, VARA: 표본 분산 계산용
  • VARP, VAR.P, VARPA: 모분산 계산용

구버전인 VARVARP는 무시해도 좋습니다. 이 함수들은 예전 스프레드시트와의 호환성을 위해 남아 있을 뿐, 최신 버전에서는 사용하지 않는 것이 좋습니다.

그렇다면 남는 선택지는 VAR.SVAR.P, 그리고 VARAVARPA입니다. VAR.S와 VAR.P는 숫자 값만으로 이루어진 데이터의 분산을 계산하고, VARA와 VARPA는 텍스트 문자열까지 포함해 계산합니다.

엑셀(EXCEL)에서 분산 계산하는 방법 완벽 가이드

VARA와 VARPA는 텍스트 문자열을 숫자 0으로 변환합니다. 단, 'TRUE'와 'FALSE'는 예외적으로 각각 1과 0으로 변환됩니다.

가장 큰 차이점은 VAR.S와 VAR.P는 숫자가 아닌 값을 건너뛴다는 점입니다. 이 경우 해당 항목들이 값의 총 개수에서 제외되므로 평균값이 달라집니다. 평균을 구할 때 나누는 항목 수가 줄어들기 때문입니다.

엑셀에서 분산 계산하는 방법

엑셀에서 분산을 계산하는 데 필요한 것은 값의 집합뿐입니다. 아래 예시에서는 VAR.S를 사용하지만, 어떤 분산 수식을 쓰든 수식 형태와 사용 방법은 완전히 동일합니다.

  1. 계산할 값의 범위 또는 개별 값들이 준비되어 있다면, 원하는 빈 셀을 선택합니다.
엑셀(EXCEL)에서 분산 계산하는 방법 완벽 가이드
  1. 수식 입력줄에 =VAR.S(XX:YY)를 입력합니다. XX와 YY는 각각 데이터 범위의 첫 번째 셀과 마지막 셀 주소로 바꿔주면 됩니다.
엑셀(EXCEL)에서 분산 계산하는 방법 완벽 가이드
  1. Enter 키를 누르면 계산이 완료됩니다.
엑셀(EXCEL)에서 분산 계산하는 방법 완벽 가이드

또는 셀 범위 대신 특정 값들을 직접 지정할 수도 있습니다. 이 경우 수식은 =VAR.S(1,2,3,4)처럼 작성하며, 괄호 안의 숫자는 분산을 구하려는 값으로 바꾸면 됩니다. 이렇게 직접 입력할 수 있는 값은 최대 254개까지 가능하지만, 값이 몇 개뿐인 경우가 아니라면 데이터를 셀 범위에 입력한 뒤 위에서 설명한 셀 범위 방식의 수식을 사용하는 것이 거의 항상 더 편리합니다.

엑셀, 이제 능숙하게 활용하세요

분산 계산은 엑셀로 통계 작업을 해야 하는 사람이라면 반드시 알아두면 유용한 기능입니다. 이 글에서 소개한 엑셀 용어 중 헷갈리는 부분이 있다면 마이크로소프트 엑셀 기초 튜토리얼을 참고해 엑셀 사용법을 먼저 익혀보는 것도 좋습니다.

반대로 더 배울 준비가 되어 있다면, 엑셀 산점도에 선형 회귀 추세선을 추가하는 방법을 확인해 보세요. 분산을 비롯해 데이터셋의 다양한 특성을 산술 평균과의 관계 속에서 시각적으로 확인할 수 있습니다.