Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

Pandas DataFrame을 월별로 그룹화하는 방법 – Python groupby & Grouper 활용법

Pandas에서는 groupby() 함수를 사용해 DataFrame을 다양한 기준으로 그룹화할 수 있습니다. 특히 날짜 데이터를 다룰 때는 pd.Grouper를 함께 사용하면 연도, 분기, 월 등 원하는 시간 단위로 데이터를 간편하게 묶을 수 있습니다.

이 글에서는 자동차 판매 기록 데이터를 예시로, 구매 날짜(Date_of_Purchase)를 기준으로 월별 그룹화를 수행하고 매월 등록 가격(Reg_Price)의 합계를 계산하는 방법을 살펴보겠습니다.

1. 예제 DataFrame 생성하기

먼저 차량명, 구매 날짜, 등록 가격 세 개의 열로 구성된 DataFrame을 만들어 보겠습니다.

import pandas as pd

dataFrame = pd.DataFrame(
    {
        "Car": ["Audi", "Lexus", "Tesla", "Mercedes", "BMW", "Toyota", "Nissan", "Bentley", "Mustang"],

        "Date_of_Purchase": [
            pd.Timestamp("2021-06-10"),
            pd.Timestamp("2021-07-11"),
            pd.Timestamp("2021-06-25"),
            pd.Timestamp("2021-06-29"),
            pd.Timestamp("2021-03-20"),
            pd.Timestamp("2021-01-22"),
            pd.Timestamp("2021-01-06"),
            pd.Timestamp("2021-01-04"),
            pd.Timestamp("2021-05-09")
        ],

        "Reg_Price": [1000, 1400, 1100, 900, 1700, 1800, 1300, 1150, 1350]
    }
)

2. Grouper로 월별 그룹화하기

groupby() 함수 안에서 pd.Grouper를 사용해 그룹화 기준이 될 Date_of_Purchase 열을 지정합니다. 이때 빈도(freq)를 'M'(월말 기준)으로 설정하면 데이터가 월 단위로 묶입니다.

print("\nGroup Dataframe by month...\n",
      dataFrame.groupby(pd.Grouper(key='Date_of_Purchase', axis=0, freq='M')).sum())

참고: Pandas 2.2 버전부터는 'M' 별칭이 더 이상 권장되지 않습니다(deprecated). 대신 'ME'(Month End)를 사용하세요. freq='ME'로 변경해도 동일한 결과를 얻을 수 있습니다.

전체 코드

import pandas as pd

# Date_of_Purchase 열을 포함하는 DataFrame
dataFrame = pd.DataFrame(
    {
        "Car": ["Audi", "Lexus", "Tesla", "Mercedes", "BMW", "Toyota", "Nissan", "Bentley", "Mustang"],

        "Date_of_Purchase": [
            pd.Timestamp("2021-06-10"),
            pd.Timestamp("2021-07-11"),
            pd.Timestamp("2021-06-25"),
            pd.Timestamp("2021-06-29"),
            pd.Timestamp("2021-03-20"),
            pd.Timestamp("2021-01-22"),
            pd.Timestamp("2021-01-06"),
            pd.Timestamp("2021-01-04"),
            pd.Timestamp("2021-05-09")
        ],

        "Reg_Price": [1000, 1400, 1100, 900, 1700, 1800, 1300, 1150, 1350]
    }
)

print("DataFrame...\n", dataFrame)

# groupby 함수 내에서 Grouper로 Date_of_Purchase 열 지정
print("\nGroup Dataframe by month...\n",
      dataFrame.groupby(pd.Grouper(key='Date_of_Purchase', axis=0, freq='M')).sum())

실행 결과

위 코드를 실행하면 아래와 같은 결과가 출력됩니다. 각 월의 등록 가격 합계가 계산되며, 판매 기록이 없는 달은 NaN으로 표시됩니다.

DataFrame...
       Car   Date_of_Purchase   Reg_Price
0     Audi   2021-06-10         1000
1    Lexus   2021-07-11         1400
2    Tesla   2021-06-25         1100
3 Mercedes   2021-06-29          900
4      BMW   2021-03-20         1700
5   Toyota   2021-01-22         1800
6   Nissan   2021-01-06         1300
7  Bentley   2021-01-04         1150
8  Mustang   2021-05-09         1350

Group Dataframe by month...
                    Reg_Price
Date_of_Purchase
2021-01-31             4250.0
2021-02-28                NaN
2021-03-31             1700.0
2021-04-30                NaN
2021-05-31             1350.0
2021-06-30             3000.0
2021-07-31             1400.0

결과 해석

그룹화 결과의 인덱스는 해당 월의 마지막 날짜(월말)로 표시됩니다. 예를 들어 2021년 1월에는 Toyota(1,800), Nissan(1,300), Bentley(1,150) 세 건의 판매가 있었으므로 합계 4,250이 계산되었습니다. 반면 판매 기록이 없는 2월과 4월은 NaN으로 나타나는데, 필요하다면 .fillna(0)을 추가해 NaN 값을 0으로 대체할 수 있습니다.