Pandas DataFrame에서 결측치(NaN)를 바로 앞 행의 값으로 채우고 싶다면 fillna() 메서드의 method 매개변수에 ffill을 지정하면 됩니다.fillna(method=ffill)참고로 Pandas 2.x 버전부터는 method 매개변수가 지원 중단(deprecated)되었기 때문에, 동일한 기능을 수행하는 전용 메서드인 ffill()을 사용하는 것을 권장합니다.예를 들어 아래와 같이 일부 NaN 값이 포함된 CSV 파일이 Microsoft Excel에 열려 있다고 가정해 보겠습니다.1. 라이브러리 임포트먼저
Pandas에서 두 개의 DataFrame을 병합할 때는 merge() 함수를 사용합니다. 병합 과정에서 일대일(one-to-one) 관계임을 명시적으로 검증하려면 merge() 함수의 validate 매개변수에 아래 값 중 하나를 설정하면 됩니다. validate = one_to_one # 또는 validate = 1:1 validate 옵션이 설정되면 병합 키가 왼쪽(left)과 오른쪽(right) 데이터셋 양쪽 모두에서 고유한지 확인합니다. 중복된 키가 발견되면 MergeError가 발생하므로, 병합 전에 데이터 무결성을 미리
Pandas DataFrame의 특정 열에서 NaN(결측값)이 몇 번 발생했는지 확인하려면 isna() 메서드를 사용합니다. 이어서 sum() 함수로 True 값을 모두 더하면 NaN의 총 개수를 손쉽게 구할 수 있습니다.먼저 필요한 라이브러리를 별칭과 함께 임포트합니다.import pandas as pd import numpy as np다음으로 DataFrame을 생성합니다. 아래 예제에서는 Units_Sold 열에 NumPy의 np.NaN을 사용해 결측값을 포함시켰습니다.dataFrame = pd.DataFrame({ Ca
Seaborn은 Python에서 통계 데이터 시각화에 널리 사용되는 라이브러리입니다. 시간의 흐름에 따른 데이터 변화를 확인하고 싶다면 시계열 플롯(Time Series Plot)이 유용하며, Seaborn에서는 lineplot() 함수 하나로 간단하게 구현할 수 있습니다. 이 글에서는 구매일자별 판매량 데이터를 예제로 시계열 선 그래프를 그리는 전체 과정을 살펴보겠습니다. 1. 필요한 라이브러리 임포트하기 가장 먼저 Seaborn과 함께 사용할 Pandas, Matplotlib 라이브러리를 불러옵니다. import seaborn
Seaborn 막대 그래프(Bar Plot)란?Seaborn의 막대 그래프는 점 추정치(point estimate)와 신뢰 구간(confidence interval)을 직사각형 막대 형태로 시각화하는 데 사용됩니다. 이를 위해 seaborn.barplot() 함수를 활용하며, order 매개변수에 원하는 순서를 명시적으로 전달하면 특정 열(column)을 기준으로 막대의 표시 순서를 자유롭게 제어할 수 있습니다.데이터셋 준비이번 예제에서는 CSV 파일 형태의 데이터셋인 Cricketers2.csv를 사용합니다.필요한 라이브러리 임포
Seaborn의 lineplot은 여러 의미론적(semantics) 그룹화 옵션을 지원하는 선 그래프(line plot)를 간편하게 그릴 수 있는 기능입니다. 이때 seaborn.lineplot() 함수를 사용합니다. 예시로, 크리켓 선수 정보가 담긴 CSV 파일(Cricketers.csv)을 데이터셋으로 활용해 보겠습니다. 1. 필요한 라이브러리 임포트 먼저 작업에 필요한 세 가지 라이브러리인 Seaborn, Pandas, Matplotlib을 임포트합니다. import seaborn as sb import pandas as pd
Seaborn의 산점도(scatter plot)는 두 변수 간의 관계를 점으로 표현하면서, 여러 의미론적 그룹화(색상·크기·스타일 등)를 함께 적용할 수 있는 강력한 시각화 기법입니다. 이를 구현하는 핵심 함수는 바로 seaborn.scatterplot()입니다.이번 글에서는 크리켓 선수 데이터(Cricketers.csv)를 예제로 사용하여, 나이(Age)와 몸무게(Weight)의 관계를 산점도로 시각화하는 방법을 단계별로 알아보겠습니다.1. 필수 라이브러리 임포트먼저 시각화에 필요한 세 가지 라이브러리를 임포트합니다.import
Seaborn 박스 플롯(Box Plot)이란? 박스 플롯은 데이터의 분포를 카테고리별로 비교하고 시각화할 때 유용한 그래프입니다. 중앙값, 사분위수 범위(IQR), 이상치(outlier)를 한눈에 파악할 수 있어 탐색적 데이터 분석(EDA)에서 널리 활용됩니다. Python의 Seaborn 라이브러리에서는 seaborn.boxplot() 함수 하나로 손쉽게 그릴 수 있습니다. 이번 글에서는 크리켓 선수 정보가 담긴 CSV 파일(Cricketers.csv)을 예제 데이터로 사용해, 박스 플롯을 그리는 과정을 단계별로 살펴보겠습니다.
Pandas의 eval() 함수는 지정한 열들을 기준으로 행 단위 합계를 손쉽게 계산할 수 있는 강력한 기능입니다. 복잡한 연산 코드를 작성하지 않고도 문자열 표현식만으로 새로운 결과 열을 만들 수 있어 코드가 간결해집니다.1. DataFrame 생성하기먼저 제품 재고 정보를 담은 DataFrame을 생성해 보겠습니다.dataFrame = pd.DataFrame({ Product: [SmartTV, ChromeCast, Speaker, Earphone], Opening_Stock: [300, 700, 1200, 150
데이터 시각화에서 누적 가로 막대 차트는 여러 항목의 값을 하나의 막대에 쌓아 올려 전체와 각 구성 요소의 비중을 한눈에 비교할 수 있게 해주는 유용한 차트입니다. Pandas에서는 plot.barh() 메서드를 사용하면 손쉽게 가로 막대 차트를 그릴 수 있으며, stacked 매개변수를 True로 설정하기만 하면 누적 형태로 표현할 수 있습니다.핵심 포인트: stacked 매개변수stacked = True1단계: 필요한 라이브러리 가져오기먼저 데이터 처리를 위한 Pandas와 시각화를 위한 Matplotlib을 임포트합니다.imp
Seaborn 바이올린 플롯이란?바이올린 플롯(Violin Plot)은 박스플롯(Boxplot)과 커널 밀도 추정(Kernel Density Estimate, KDE)을 하나로 결합한 시각화 기법입니다. 단순히 최솟값·최댓값·중앙값만 보여주는 박스플롯과 달리, 데이터가 어떤 구간에 얼마나 밀집되어 있는지 곡선의 두께로 직관적으로 확인할 수 있다는 것이 가장 큰 장점입니다.Python의 대표적인 데이터 시각화 라이브러리인 Seaborn에서는 seaborn.violinplot() 함수를 사용해 손쉽게 바이올린 플롯을 그릴 수 있습니다.
수평 추세란?수평 추세(Horizontal Trend)는 정체 추세(Stationary Trend)라고도 부릅니다. 이는 시간이 지나도 데이터 값이 크게 상승하거나 하락하지 않고 일정한 수준을 유지하는 패턴을 의미합니다. 이 글에서는 CSV 형식의 판매 기록 데이터셋(SalesRecords3.csv)을 사용하여 수평 추세를 그래프로 시각화하는 방법을 알아보겠습니다.필요한 라이브러리 가져오기먼저 데이터 처리를 위한 pandas와 시각화를 위한 matplotlib.pyplot 라이브러리를 가져옵니다.import pandas as pd
Pandas DataFrame에서 열 이름(헤더)을 명시적으로 지정하려면 read_csv() 메서드의 names 매개변수를 사용하면 됩니다. 먼저 Microsoft Excel로 열어 본, 헤더가 없는 CSV 파일의 예는 다음과 같습니다. 이제 CSV 파일에서 데이터를 불러오면서 names 매개변수를 활용해 헤더 열을 추가해 보겠습니다. pd.read_csv(C:\\Users\\amit_\\Desktop\\TeamData.csv, names=[Team, Rank_Points, Year]) 전체 예제 코드 다음은 전체 과정을 담은 완
Seaborn의 스웜 플롯(Swarm Plot)은 범주형 데이터를 산점도 형태로 시각화하되, 점들이 서로 겹치지 않도록 배치하는 그래프입니다. 데이터의 분포와 밀도를 한눈에 파악할 수 있어 범주형 변수와 수치형 변수의 관계를 분석할 때 매우 유용합니다.Seaborn에서는 seaborn.swarmplot() 함수를 사용하여 스웜 플롯을 손쉽게 그릴 수 있습니다.데이터셋 준비이번 예제에서는 크리켓 선수 정보가 담긴 CSV 파일인 Cricketers.csv를 사용하겠습니다.필요한 라이브러리 불러오기먼저 시각화와 데이터 처리에 필요한 세
Seaborn의 막대 그래프(Bar Plot)는 점 추정치(point estimate)와 신뢰 구간(confidence interval)을 사각형 막대 형태로 시각화하는 데 사용되는 강력한 도구입니다. 이를 위해 seaborn.barplot() 함수를 활용하며, 카테고리별 평균값 비교나 통계적 분석 결과를 한눈에 파악할 수 있도록 도와줍니다.1. 필요한 라이브러리 임포트먼저 시각화와 데이터 처리에 필요한 세 가지 라이브러리를 임포트합니다.import seaborn as sb import pandas as pd import matpl
데이터 시각화에서 포인트 플롯(Point Plot)은 범주형 변수에 따른 수치형 변수의 평균 변화를 점과 선으로 표현하는 강력한 도구입니다. 이 글에서는 Python의 Seaborn 라이브러리에서 제공하는 seaborn.pointplot() 함수를 사용해 포인트 플롯을 만드는 방법을 단계별로 알아보겠습니다.1. 필요한 라이브러리 임포트먼저 시각화와 데이터 처리에 필요한 세 가지 라이브러리를 임포트합니다.import seaborn as sb import pandas as pd import matplotlib.pyplot as plt2
Seaborn의 카운트 플롯(Count Plot)은 범주형 데이터의 각 항목별 관측치 개수를 막대그래프로 시각화하는 데 사용됩니다. 이를 위해 seaborn.countplot() 함수를 활용하며, 데이터 분포를 한눈에 파악할 수 있어 탐색적 데이터 분석(EDA)에서 매우 유용하게 쓰입니다.이번 글에서는 CSV 파일로 저장된 크리켓 선수 데이터셋(Cricketers.csv)을 예제로 사용해 카운트 플롯을 그리는 방법을 단계별로 살펴보겠습니다.1. 필요한 라이브러리 불러오기먼저 시각화와 데이터 처리에 필요한 세 가지 라이브러리를 임포트
가로 막대 차트란?가로(수평) 막대 차트를 그리려면 pandas.DataFrame.plot.barh() 메서드를 사용합니다. 막대 차트는 개별 범주 간의 값을 비교하는 데 유용하며, 특히 항목 이름이 길거나 범주의 수가 많을 때 세로 막대 차트보다 가독성이 뛰어납니다.필요한 라이브러리 임포트먼저 차트 작성에 필요한 pandas와 matplotlib 라이브러리를 임포트합니다.import pandas as pdimport matplotlib.pyplot as pltDataFrame 생성하기차종(Car), 배기량(Cubic_Capacit
Seaborn의 상자 그림(Box Plot)은 카테고리(범주형 변수)에 따른 데이터 분포를 한눈에 보여주는 강력한 시각화 도구입니다. 수직 방향의 상자 그림을 그리려면 seaborn.boxplot() 함수를 사용하면 됩니다.이번 튜토리얼에서는 크리켓 선수 정보가 담긴 CSV 파일(Cricketers.csv)을 예제 데이터셋으로 사용합니다.1단계: 필수 라이브러리 가져오기먼저 시각화와 데이터 처리에 필요한 라이브러리들을 임포트합니다.import seaborn as sbimport pandas as pdimport matplotlib.
Seaborn의 바이올린 플롯(Violin Plot)은 박스플롯(boxplot)과 커널 밀도 추정(Kernel Density Estimate)을 하나의 그래프로 결합하여 데이터 분포를 직관적으로 보여주는 시각화 기법입니다. 이를 구현하려면 seaborn.violinplot() 함수를 사용합니다.이 글에서는 order 매개변수를 활용해 범주의 표시 순서를 명시적으로 지정하는 방법과, inner 매개변수를 통해 실제 관측값(observation)을 함께 표시하는 방법을 알아보겠습니다.데이터 준비이 예제에서는 크리켓 선수 정보가 담긴 C