Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

Python Pandas – DataFrame에서 초기 공백(Whitespace) 건너뛰는 방법

Pandas DataFrame에서 CSV 파일을 읽어들일 때 값 앞에 포함된 불필요한 초기 공백(initial space)을 제거하려면 read_csv() 메서드의 skipinitialspace 매개변수를 활용하면 됩니다. 이 매개변수를 True로 설정하면 구분자 뒤에 따라오는 여분의 공백이 자동으로 제거됩니다.

예제 CSV 파일

다음과 같은 자동차 판매 기록 CSV 파일이 있다고 가정해 보겠습니다. 일부 데이터 항목 앞에는 공백이 포함되어 있습니다.

Python Pandas – DataFrame에서 초기 공백(Whitespace) 건너뛰는 방법

전체 코드 예제

아래는 skipinitialspace 매개변수 사용 전후를 비교할 수 있는 전체 코드입니다.

import pandas as pd

# CSV 파일 읽기 (기본 설정)
dataFrame = pd.read_csv("C:\\Users\\amit_\\Desktop\\CarRecords.csv")
print("DataFrame...\n", dataFrame)

# CSV 파일 읽기 + 초기 공백 제거
dataFrame = pd.read_csv("C:\\Users\\amit_\\Desktop\\CarRecords.csv", skipinitialspace=True)
print("DataFrame...\n", dataFrame)

1단계: CSV 파일 읽기

먼저 바탕화면에 저장된 CSV 파일을 일반적인 방식으로 읽어옵니다.

dataFrame = pd.read_csv("C:\\Users\\amit_\\Desktop\\CarRecords.csv")

2단계: skipinitialspace 옵션 적용

파일을 읽을 때 skipinitialspace=True 옵션을 추가하면 각 필드 앞의 공백이 제거된 깔끔한 DataFrame을 얻을 수 있습니다.

dataFrame = pd.read_csv("C:\\Users\\amit_\\Desktop\\CarRecords.csv", skipinitialspace=True)

실행 결과

위 코드를 실행하면 다음과 같은 출력 결과를 확인할 수 있습니다. 첫 번째 출력에서는 공백이 그대로 유지되지만, 두 번째 출력에서는 초기 공백이 제거되어 열 정렬이 훨씬 깔끔해진 것을 볼 수 있습니다.

DataFrame...
          Car       Place   UnitsSold
0         Audi   Bangalore          80
1      Porsche      Mumbai         110
2  RollsRoyce        Pune         100
3         BMW       Delhi         200
4    Mercedes   Hyderabad          80
5 Lamborghini  Chandigarh          80
6         Audi      Mumbai          60
7    Mercedes        Pune         120
8 Lamborghini       Delhi         100
DataFrame...
          Car       Place   UnitsSold
0         Audi   Bangalore          80
1      Porsche      Mumbai         110
2  RollsRoyce        Pune         100
3         BMW       Delhi         200
4    Mercedes   Hyderabad          80
5 Lamborghini  Chandigarh          80
6         Audi      Mumbai          60
7    Mercedes        Pune         120
8 Lamborghini       Delhi         100

정리

skipinitialspace=True 옵션은 특히 외부 시스템에서 생성된 CSV 파일처럼 구분자(쉼표) 뒤에 공백이 포함되기 쉬운 데이터를 다룰 때 매우 유용합니다. 별도의 후처리 작업 없이 파일을 읽는 단계에서 공백 문제를 해결할 수 있어, 데이터 정제 과정을 크게 단축시켜 줍니다.