데이터 분석을 하다 보면 숫자형(numeric)으로 구성된 특정 열(column)의 평균값을 계산해야 하는 경우가 종종 발생합니다. 이럴 때 pandas에서 제공하는 mean 함수를 활용하면 아주 간단하게 해결할 수 있습니다.
평균을 구하고자 하는 열을 데이터프레임에서 인덱싱한 뒤, 점(.) 연산자를 사용해 해당 열에 mean 함수를 호출하면 됩니다. 열 이름 대신 열의 인덱스 위치를 전달하여 평균을 구하는 것도 가능합니다. 여기서 mean()이란 데이터셋에 있는 모든 값의 합을 값의 총 개수로 나눈 값을 의미합니다.
그럼 실제 예제를 통해 살펴보겠습니다.
예제 코드
import pandas as pd
my_data = {'Name':pd.Series(['Tom','Jane','Vin','Eve','Will']),'Age':pd.Series([45, 67, 89, 12, 23]),'value':pd.Series([8.79,23.24,31.98,78.56,90.20])}
print("The dataframe is :")
my_df = pd.DataFrame(my_data)
print(my_df)
print("The mean of column 'Age' is :")
print(my_df['Age'].mean())
print("The mean of column 'value' is :")
print(my_df['value'].mean())
실행 결과
The dataframe is :
Name Age value
0 Tom 45 8.79
1 Jane 67 23.24
2 Vin 89 31.98
3 Eve 12 78.56
4 Will 23 90.20
The mean of column 'Age' is :
47.2
The mean of column 'value' is :
46.553999999999995
코드 설명
필요한 라이브러리를 임포트하고, 사용 편의성을 위해 별칭(alias)을 지정합니다.
키(key)와 값(value)으로 구성된 시리즈 딕셔너리를 생성합니다. 여기서 값은 실제로 시리즈(Series)라는 데이터 구조입니다.
생성한 딕셔너리는 이후 pandas 라이브러리의 'DataFrame' 함수에 매개변수로 전달됩니다.
완성된 데이터프레임을 콘솔에 출력합니다.
숫자형 값을 담고 있는 특정 열의 평균을 계산합니다.
mean 함수는 점 연산자를 사용해 데이터프레임에서 특정 열 이름을 지정하여 호출합니다.
계산된 해당 열의 평균값이 콘솔에 출력됩니다.