Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

Python Pandas DataFrame 통계 요약 한눈에 보기 – describe() 메서드 완벽 가이드

Pandas에서 describe() 메서드를 사용하면 DataFrame의 주요 통계 정보를 손쉽게 요약할 수 있습니다. 이 메서드는 개수(count), 평균(mean), 표준편차(std), 최솟값(min), 사분위수(25%, 50%, 75%), 최댓값(max) 등의 기술통계를 한 번에 출력해 줍니다.

1. Pandas 라이브러리 불러오기

먼저 pandas 라이브러리를 관례적으로 사용하는 별칭 pd로 가져옵니다.

import pandas as pd

2. CSV 파일로 DataFrame 생성하기

다음은 예제로 사용할 CSV 파일입니다. read_csv() 함수를 이용해 파일을 읽어와 Pandas DataFrame을 생성합니다.

dataFrame = pd.read_csv("C:\\Users\\amit_\\Desktop\\CarRecords.csv")

3. describe()로 통계 요약 확인하기

생성된 DataFrame의 통계 요약은 아래와 같이 describe() 메서드를 호출하는 것만으로 간단히 확인할 수 있습니다.

dataFrame.describe()

전체 예제 코드

지금까지의 과정을 하나로 합친 전체 코드는 다음과 같습니다. DataFrame 출력, 행과 열 개수 확인, 통계 요약, 상위 7개 행 조회까지 함께 살펴볼 수 있습니다.

import pandas as pd

# CSV 파일 읽기
dataFrame = pd.read_csv("C:\\Users\\amit_\\Desktop\\CarRecords.csv")
print("DataFrame...\n", dataFrame)

# DataFrame의 행과 열 개수 확인
print("\nDataFrame의 행과 열 개수 = ", dataFrame.shape)

# DataFrame의 통계 요약 출력
print("\nDataFrame의 통계 요약 = \n", dataFrame.describe())

# 상위 7개 행만 출력
print("\n특정 개수의 행만 조회한 DataFrame...\n", dataFrame.head(7))

실행 결과

위 코드를 실행하면 다음과 같은 결과가 출력됩니다.

DataFrame...
          Car       Place   UnitsSold
0        Audi   Bangalore          80
1     Porsche      Mumbai         110
2  RollsRoyce        Pune         100
3         BMW       Delhi          95
4    Mercedes   Hyderabad          80
5 Lamborghini  Chandigarh          80
6        Audi      Mumbai         100
7    Mercedes        Pune         120
8 Lamborghini       Delhi         100

DataFrame의 행과 열 개수 = (9, 3)

DataFrame의 통계 요약 =
        UnitsSold
count    9.000000
mean    96.111111
std     14.092945
min     80.000000
25%     80.000000
50%    100.000000
75%    100.000000
max    120.000000

특정 개수의 행만 조회한 DataFrame ...
          Car       Place   UnitsSold
0        Audi   Bangalore          80
1     Porsche      Mumbai         110
2  RollsRoyce        Pune         100
3         BMW       Delhi          95
4    Mercedes   Hyderabad          80
5 Lamborghini  Chandigarh          80
6        Audi      Mumbai         100

출력 결과 해석

describe() 결과에 포함되는 각 통계 항목의 의미는 다음과 같습니다.

  • count: 결측값을 제외한 데이터 개수
  • mean: 산술 평균
  • std: 표준편차 (데이터가 평균으로부터 퍼져 있는 정도)
  • min: 최솟값
  • 25%: 제1사분위수 (하위 25% 지점의 값)
  • 50%: 중앙값(median)
  • 75%: 제3사분위수 (하위 75% 지점의 값)
  • max: 최댓값

참고로 describe()는 숫자형 열에 대해서만 위와 같은 통계를 계산하며, 문자열(object) 열이 포함된 경우에는 해당 열이 자동으로 제외됩니다. 문자열 열의 요약이 필요하다면 include='all' 옵션을 활용할 수 있습니다.