Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

Python Seaborn으로 여러 변수가 있는 데이터 시각화하기: pairplot 함수 완벽 가이드


Seaborn은 데이터 시각화를 손쉽게 도와주는 파이썬 라이브러리로, 세련된 기본 테마와 높은 수준의 인터페이스를 제공합니다. 실제 데이터 분석 현장에서 다루는 데이터셋은 대부분 여러 개의 변수(특성)로 구성되어 있습니다. 때로는 데이터셋 안의 모든 변수가 서로 어떤 관계를 맺고 있는지 한눈에 파악해야 할 필요가 있는데, 이때 변수 쌍마다 일일이 이변량(bivariate) 분포 그래프를 그리면 시간이 많이 걸릴 뿐만 아니라 코드도 복잡해집니다.

바로 이런 상황에서 유용한 것이 다중 쌍별(pairwise) 이변량 분포 시각화입니다. Seaborn의 pairplot 함수를 사용하면 데이터프레임에 포함된 변수들의 모든 조합에 대한 관계를 단 한 번의 호출로 시각화할 수 있으며, 결과물에는 각 변수의 단변량(univariate) 분포까지 함께 나타납니다.

pairplot 함수 문법

seaborn.pairplot(data,…)

그럼 실제 예제를 통해 pairplot을 그래프로 그리는 과정을 살펴보겠습니다.

예제

import pandas as pd
import seaborn as sb
from matplotlib import pyplot as plt

my_df = sb.load_dataset('iris')
sb.set_style("ticks")
sb.pairplot(my_df, hue='species', diag_kind="kde", kind="scatter", palette="husl")
plt.show()

출력 결과

Python Seaborn으로 여러 변수가 있는 데이터 시각화하기: pairplot 함수 완벽 가이드


Python Seaborn으로 여러 변수가 있는 데이터 시각화하기: pairplot 함수 완벽 가이드

코드 설명

  • pandas, seaborn, matplotlib 등 필요한 패키지를 먼저 임포트합니다.
  • load_dataset 함수를 사용해 Seaborn에 내장된 아이리스(iris) 데이터셋을 불러옵니다.
  • 불러온 데이터는 my_df라는 이름의 데이터프레임에 저장됩니다.
  • set_style("ticks")를 통해 그래프의 전체적인 스타일을 지정합니다.
  • pairplot 함수에 데이터프레임을 첫 번째 매개변수로 전달하여 데이터를 시각화합니다.
  • hue='species' 옵션은 붓꽃 품종(species)별로 서로 다른 색상을 적용해 데이터를 구분해 줍니다.
  • diag_kind="kde" 옵션은 대각선 위치에 히스토그램 대신 커널 밀도 추정(KDE) 곡선을 그리도록 설정합니다.
  • kind="scatter" 옵션은 변수 쌍 간의 관계를 산점도(scatter plot) 형태로 표현하도록 지정합니다.
  • palette="husl" 옵션으로 그래프에 사용할 색상 팔레트를 정합니다.
  • 마지막으로 plt.show()를 호출해 완성된 그래프를 화면에 출력합니다.