Computer >> 컴퓨터 >  >> 소프트웨어 >> Office

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

분산 분석(ANOVA)은 데이터 세트 내의 변동성을 통계적으로 검증할 수 있는 강력한 분석 도구입니다. 1918년에 처음 개발된 이후로 지금까지 널리 활용되어 왔으며, 여러 그룹 간 평균의 통계적 차이를 보여주고 각 값들이 서로 어떻게 상관관계를 맺는지 판단하는 데 사용됩니다. 그중 중첩 ANOVA(Nested ANOVA)는 하나 이상의 요인(factor)이 다른 요인 안에 하위 구조로 포함되어 있는 경우에 적용하는 분석 방법입니다. 이 글에서는 중첩 ANOVA의 기본 개념과 Excel에서 이를 수행하는 구체적인 방법을 단계별로 살펴보겠습니다.

ANOVA(분산 분석)란 무엇일까요?

ANOVA는 데이터 세트에서 관찰되는 분산을 분석하기 위한 통계 기법입니다. 이를 수행하려면 먼저 데이터를 체계적 요인(systematic factors)무작위 요인(random factors) 두 부분으로 나누어야 합니다.

ANOVA를 활용하면 어떤 요인이 주어진 데이터에 유의미한 영향을 미치는지 확인할 수 있습니다. 분석을 마친 후에는 일반적으로 데이터의 비일관성에 큰 영향을 준 요인들을 대상으로 추가 분석을 진행합니다. 이때 ANOVA 결과를 바탕으로 회귀 분석에 필요한 추가 데이터를 생성하게 됩니다. 즉, ANOVA는 여러 데이터 세트를 서로 비교하여 그들 사이에 연관성이 있는지를 판단하는 도구라고 할 수 있습니다.

ANOVA에는 두 가지 유형이 있습니다. 하나는 일원 배치(단일 요인) ANOVA이고, 다른 하나는 이원 배치(두 요인) ANOVA입니다. 단일 요인 ANOVA는 하나의 요인이 하나의 종속 변수에 미치는 영향을 찾아내는 반면, 두 요인 ANOVA는 두 개의 독립 변수가 종속 변수에 미치는 영향을 동시에 분석합니다.

중첩 ANOVA 개념 정리

중첩 ANOVA는 이름 그대로 최소한 하나의 요인이 다른 요인 안에 중첩(nested)되어 있는 구조를 의미합니다.

예를 들어, 특정 회사가 서로 다른 지역에 두 개의 매장을 운영한다고 가정해 보겠습니다. 첫 번째 매장에는 A팀과 B팀이, 두 번째 매장에는 C팀과 D팀이 있다고 할 때, 각 팀의 매출 데이터는 자신이 속한 매장 안에 중첩되어 있는 셈입니다.

구조를 그림으로 표현하면 다음과 같습니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

그림에서 볼 수 있듯이 두 번째 요인(팀)이 첫 번째 요인(매장) 안에 중첩되어 있습니다. 따라서 이러한 매출 데이터에 대한 ANOVA 분석은 중첩 ANOVA 범주에 속하게 됩니다.

이 데이터를 스프레드시트에 입력하면 아래와 같은 형태가 됩니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

이 데이터에서 우리는 두 가지를 분석할 수 있습니다. 첫째, 매출이 매장별(요인 1)로 고른가? 둘째, 매출이 팀별(요인 2)로 고른가?

이 데이터에 ANOVA를 수행하면(자세한 과정은 뒤에서 설명) 다음과 같은 결과를 얻게 됩니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

여기서 p-값(p-value)은 각 요인의 유의성을 판단하는 기준이 됩니다. 이 데이터에서는 매장이 통계적으로 유의미한 영향을 미치는 반면, 매장 내 팀들은 유의미하지 않다는 것을 알 수 있습니다.

Excel에서 중첩 ANOVA 수행하는 방법

안타깝게도 Excel에는 중첩 ANOVA를 직접 수행하는 기능이 없습니다. 하지만 데이터 세트를 적절히 재구성하고 몇 가지 수식을 직접 계산하면 충분히 분석을 수행할 수 있습니다. 여기서는 데이터 분석 도구(Data Analysis Toolpak)재현 있는 이원 배치(Two Factor with Replication) 기능을 활용합니다. 참고로 데이터 분석 도구는 리본 메뉴에 기본적으로 표시되어 있지 않을 수 있으니, 사전에 데이터 분석 도구를 활성화해 두어야 합니다. 또한 마지막 수동 계산 단계에서는 F.DIST.RT 함수가 필요합니다.

먼저 원본 데이터 세트를 약간 수정해야 합니다. 재현 있는 이원 배치 분석을 수행하려면 데이터 구조를 조정해야 하기 때문입니다. 앞서 살펴본 원본 데이터를 그대로 사용하겠습니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

이제 아래 단계를 따라 Excel에서 중첩 ANOVA를 수행하는 방법을 확인해 보겠습니다.

단계:

  • 먼저 데이터 세트를 다음과 같이 재배열합니다. Excel이 데이터를 읽을 수 있도록 C팀과 D팀의 매출 값을 A와 B 열 아래에 포함시켰습니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 리본 메뉴에서 데이터(Data) 탭으로 이동합니다.
  • 분석(Analyze) 그룹에서 데이터 분석(Data Analysis)을 선택합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 데이터 분석(Data Analysis) 대화상자가 나타납니다.
  • 분석 도구(Analysis Tools) 목록에서 Anova: Two-Factor with Replication(분산 분석: 이원 배치 복제)을 선택합니다.
  • 확인(OK)을 클릭합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 다음으로 Anova: Two-Factor With Replication 대화상자가 열리면 아래 항목들을 설정합니다.
  • 첫째, 입력 범위(Input Range)에 B4:D12를 입력합니다.
  • 둘째, 샘플당 행 수(Rows per sample) 필드에 4를 입력합니다. 중첩된 각 요인에 대해 4개의 데이터 항목이 있기 때문입니다.
  • 유의 수준(Alpha) 값도 필요에 따라 변경할 수 있지만, 여기서는 기본값인 0.05를 유지합니다.
  • 셋째, 출력 옵션(Output options)에서 결과를 표시할 위치를 선택합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 모든 설정을 마쳤으면 확인(OK)을 클릭합니다.
  • 그러면 지정한 위치에 분석 결과가 나타납니다. 중첩 ANOVA 분석을 위해서는 결과 하단의 ANOVA 표 부분을 사용합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • F25의 표본(sample) p-값은 첫 번째 요인인 '매장'의 유의성을 나타냅니다.
  • 다른 요인의 유의성을 확인하려면 이제 몇 가지 수동 계산이 필요합니다.
  • 먼저 셀 B34를 선택하고 다음 수식을 입력합니다.

=B26+B27

  • Enter 키를 누릅니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 다음으로 셀 C34에 아래 수식을 입력하고 Enter 키를 누릅니다.

=C26+C27

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 이어서 셀 D34에 아래 수식을 입력하고 Enter 키를 누릅니다.

=B34/C34

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 그런 다음 셀 E34에 아래 수식을 입력합니다.

=D34/D28

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 마지막으로 셀 F34에 아래 수식을 입력하고 Enter 키를 누릅니다.

=F.DIST.RT(E34,C34,C28)

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

결과 해석

ANOVA 분석에서 어떤 요인의 p-값이 0.05보다 작으면 해당 요인은 데이터에 유의미한 영향을 미친다고 해석합니다. 이 예제에서는 매장과 팀이라는 두 요인이 있었고, 팀은 매장 안에 중첩되어 있었습니다. 매장의 p-값은 셀 F25에, 팀의 p-값은 셀 F34에 위치합니다.

결과에서 보듯이 매장의 p-값은 0.011005로 0.05보다 낮습니다. 이는 매장 요인이 매출에 유의미한 영향을 미친다는 것을 의미합니다. 반면 팀 요인의 p-값은 0.9202로 0.05보다 높으므로, 데이터(매출)에 유의미한 영향을 미치지 않습니다. 따라서 이 경우 직원들의 팀 조합보다 매장 위치가 더 중요하다는 결론을 내릴 수 있습니다.

지금까지 Excel에서 중첩 ANOVA를 수행하는 방법을 살펴보았습니다.

Excel 중첩 ANOVA 실전 예제 2가지

중첩 ANOVA를 수행하는 기본 원리는 Excel에서도 동일합니다. 이제 서로 다른 두 가지 예제에 같은 방법을 적용하여 다양한 상황에서의 활용법을 보여드리겠습니다. 리본 메뉴에서 데이터 분석 도구를 사용할 수 있어야 한다는 점을 잊지 마세요. 활성화되어 있지 않다면 먼저 설정을 완료해야 합니다.

예제 1. 서로 다른 길이별 저항값의 분산 계산

첫 번째 예제에서는 다음 데이터 세트를 사용합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

여기에는 두 겹의 중첩 구조가 있습니다. 저항값은 길이 안에 중첩되어 있고, 길이는 다시 서로 다른 샘플 안에 중첩되어 있습니다.

기본적인 접근 방식은 앞선 예제와 같습니다. 데이터 세트에 재현 있는 이원 배치(Two-Factor With Replication) 분석을 적용하고, 마지막 수동 계산을 위해 F.DIST.RT 함수를 사용합니다. 아래 단계를 따라 이 중첩 데이터 세트에 대해 Excel에서 ANOVA를 수행하는 방법을 확인해 보겠습니다.

단계:

  • 먼저 리본 메뉴에서 데이터(Data) 탭으로 이동합니다.
  • 분석(Analyze) 그룹에서 데이터 분석(Data Analysis)을 선택합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 데이터 분석(Data Analysis) 대화상자가 나타납니다.
  • 분석 도구(Analysis Tools) 목록에서 Anova: Two-Factor with Replication을 선택합니다.
  • 확인(OK)을 클릭합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • Anova: Two-Factor With Replication 대화상자에서 다음 항목들을 설정합니다.
  • 첫째, 입력 범위(Input Range)에 B4:F12를 입력합니다.
  • 둘째, 샘플당 행 수(Rows per sample) 필드에 4를 입력합니다. 각 중첩 요인당 4개의 항목이 있기 때문입니다.
  • 유의 수준(Alpha)은 필요에 따라 조정할 수 있지만, 여기서는 0.05를 유지합니다.
  • 셋째, 출력 옵션(Output options)에서 결과를 표시할 위치를 지정합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 설정을 모두 마쳤으면 확인(OK)을 클릭합니다.
  • 결과가 지정한 위치에 출력됩니다. 마찬가지로 하단의 ANOVA 표 부분을 활용합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • F25의 표본 p-값은 첫 번째 요인인 '샘플'의 유의성을 나타냅니다.
  • 이제 셀 B34를 선택하고 아래 수식을 입력합니다.

=B26+B27

  • Enter 키를 누릅니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 다음으로 셀 C34에 아래 수식을 입력하고 Enter 키를 누릅니다.

=C26+C27

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 이어서 셀 D34에 아래 수식을 입력하고 Enter 키를 누릅니다.

=B34/C34

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 그런 다음 셀 E34에 아래 수식을 입력합니다.

=D34/D28

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 마지막으로 셀 F34에 아래 수식을 입력하고 Enter 키를 누릅니다.

=F.DIST.RT(E34,C34,C28)

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

결과 해석

최종 결과에서 셀 F25의 p-값은 샘플(서로 다른 길이)의 유의성을, 셀 F34의 값은 저항에 대한 길이의 유의성을 나타냅니다. 두 값 모두 유의 수준(alpha)인 0.05보다 낮으므로, 이 예제에서 두 요인 모두 유의미한 요인이라고 결론지을 수 있습니다.

예제 2. 서로 다른 반(class)별 과목 점수의 분산 분석

두 번째 예제에서는 다음 데이터 세트를 사용합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

언뜻 보면 이원 배치 ANOVA(two-way ANOVA)용 데이터처럼 보일 수 있지만, 이것 역시 Excel에서 분석을 수행하기 위해 재배열된 중첩 ANOVA 데이터입니다. 앞선 예제와 마찬가지로 마지막 수동 계산에는 F.DIST.RT 함수가 필요합니다.

아래 단계를 따라 이 중첩 ANOVA를 Excel에서 수행하는 방법을 확인해 보겠습니다.

단계:

  • 먼저 리본 메뉴에서 데이터(Data) 탭으로 이동합니다.
  • 분석(Analyze) 그룹에서 데이터 분석(Data Analysis)을 선택합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 데이터 분석(Data Analysis) 대화상자가 나타납니다.
  • 분석 도구(Analysis Tools) 목록에서 Anova: Two-Factor with Replication을 선택합니다.
  • 확인(OK)을 클릭합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • Anova: Two-Factor With Replication 대화상자에서 다음 항목들을 설정합니다.
  • 첫째, 입력 범위(Input Range)에 B5:F11을 입력합니다.
  • 둘째, 샘플당 행 수(Rows per sample) 필드에 3을 입력합니다. 각 중첩 요인당 3개의 항목이 있기 때문입니다.
  • 유의 수준(Alpha)은 필요에 따라 조정할 수 있지만, 여기서는 0.05를 유지합니다.
  • 셋째, 출력 옵션(Output options)에서 결과를 표시할 위치를 지정합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 설정을 모두 마쳤으면 확인(OK)을 클릭합니다.
  • 결과가 지정한 위치에 출력됩니다. 하단의 ANOVA 표 부분을 활용합니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • F25의 표본 p-값은 첫 번째 요인인 '반(section)'의 유의성을 나타냅니다.
  • 이제 셀 B34를 선택하고 아래 수식을 입력합니다.

=B26+B27

  • Enter 키를 누릅니다.

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 다음으로 셀 C34에 아래 수식을 입력하고 Enter 키를 누릅니다.

=C26+C27

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 이어서 셀 D34에 아래 수식을 입력하고 Enter 키를 누릅니다.

=B34/C34

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 그런 다음 셀 E34에 아래 수식을 입력합니다.

=D34/D28

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

  • 마지막으로 셀 F34에 아래 수식을 입력하고 Enter 키를 누릅니다.

=F.DIST.RT(E34,C34,C28)

Excel에서 중첩 ANOVA(중첩 분산 분석) 수행하는 방법: 개념부터 실전 예제까지

결과 해석

F25의 p-값은 통계 과목 점수에 대한 '반' 요인의 유의성을 나타냅니다. 이 값은 유의 수준 0.05보다 크므로 유의미한 영향이 없다고 해석됩니다. 셀 F34의 값은 데이터 세트에서 과목별 점수에 대한 p-값입니다. 이 값 역시 0.05보다 높으므로, 이 데이터 세트에서는 서로 다른 반 간의 과목 점수 차이에 유의미한 효과가 없다는 결론을 내릴 수 있습니다.

이것이 Excel에서 중첩 ANOVA를 수행하는 또 다른 예제였습니다.

중첩 ANOVA에 대해 기억해야 할 사항

  • 중첩 ANOVA는 두 개 이상의 요인을 가질 수 있습니다. 앞선 첫 번째 예제에서처럼 하나의 요인이 다른 요인 안에 중첩될 수 있고, 그 요인이 다시 동일한 수준의 다른 요인들과 함께 더 상위 계층의 요인 안에 중첩될 수도 있습니다.
  • 중첩 ANOVA는 이원 배치 ANOVA(two-way ANOVA)와 다릅니다. 이원 배치 ANOVA는 두 개의 독립적인 요인으로 구성되지만, 중첩 ANOVA는 두 요인 중 하나가 반드시 다른 요인 안에 중첩되어 있어야 합니다. 이것이 두 분석 방법의 핵심적인 차이점입니다.

마무리

지금까지 Excel에서 중첩 ANOVA를 수행하는 방법을 알아보았습니다. 재현 있는 이원 배치 기능을 활용한 중첩 ANOVA의 개념을 잘 이해하셨기를 바라며, 이를 여러분의 데이터 세트 분석에 적극 활용하시길 바랍니다. 이 가이드가 도움이 되었기를 바랍니다. 궁금한 점이나 제안 사항이 있다면 댓글로 알려주세요.