이번 튜토리얼에서는 Pandas 시리즈(Series)에 저장된 각 문자열의 길이를 구하는 방법을 알아봅니다. Pandas 라이브러리에서 제공하는 str.len() 함수를 사용하면 벡터화 연산을 통해 모든 문자열의 길이를 한 번에 손쉽게 계산할 수 있습니다.
알고리즘
전체 과정은 다음 세 단계로 진행됩니다.
1단계: 문자열로 구성된 Pandas 시리즈를 정의합니다. 2단계: str.len() 함수를 사용하여 각 문자열의 길이를 계산합니다. 3단계: 계산 결과를 출력합니다.
예제 코드
아래 예제에서는 네 개의 문자열("Foo", "bar", "London", "Quarantine")으로 시리즈를 만든 뒤, 각 문자열의 길이를 구해 출력합니다.
import pandas as pd
series = pd.Series(["Foo", "bar", "London", "Quarantine"])
print("Series: \n", series)
length = series.str.len()
print("Length:\n", length)실행 결과
Series: 0 Foo 1 bar 2 London 3 Quarantine dtype: object Length: 0 3 1 3 2 6 3 10 dtype: int64
설명
str.len() 함수는 시리즈의 각 요소에 대해 해당 문자열의 글자 수를 반환하며, 그 결과는 원래 시리즈와 동일한 인덱스를 가지는 새로운 시리즈로 출력됩니다. 위 예제에서는 "Foo"와 "bar"는 3글자, "London"은 6글자, "Quarantine"은 10글자임을 확인할 수 있습니다.
참고로 str.len()은 결측값(NaN)이 포함된 경우에도 안전하게 동작하며, 결측값에 대해서는 NaN을 그대로 반환합니다. 또한 공백도 글자 수에 포함되므로, 필요하다면 .str.strip() 등을 먼저 적용해 전처리한 후 길이를 계산하는 것이 좋습니다.