Pandas 라이브러리의 시리즈(Series)는 인덱스 값을 사용자가 직접 지정할 수 있습니다. 이렇게 만든 사용자 지정 인덱스는 series_name[index_value] 형태로 특정 데이터에 접근할 때 활용됩니다. 시리즈에 전달된 index_value는 원본 시리즈의 인덱스와 비교되며, 일치하는 항목이 발견되면 해당 데이터가 콘솔에 출력됩니다. 그렇다면 여러 개의 요소를 한 번에 가져오려면 어떻게 해야 할까요? 아래 예제를 통해 살펴보겠습니다. 예제 import pandas as pd my_data = [34, 56, 78,
Pandas 시리즈에서 인덱스 값을 사용자 지정하면 series_name[index_value] 형태로 해당 요소에 접근할 수 있습니다. 이때 전달된 index_value는 원본 시리즈의 인덱스와 비교되며, 일치하는 값이 발견되면 그에 해당하는 데이터가 콘솔에 출력됩니다.반면, 접근하려는 인덱스가 시리즈에 존재하지 않으면 KeyError 오류가 발생합니다. 아래 예제를 통해 직접 확인해 보겠습니다.예제 코드import pandas as pd my_data = [34, 56, 78, 90, 123, 45] my_index = [ab,
데이터프레임(DataFrame)은 데이터를 행과 열의 표 형태로 저장하는 2차원 데이터 구조입니다.SQL 데이터 테이블이나 엑셀 시트와 유사하게 시각화할 수 있어, 표 형식의 데이터를 다룰 때 가장 널리 사용되는 자료구조 중 하나입니다.데이터프레임은 다음과 같은 생성자를 통해 만들 수 있습니다.pd.DataFrame(data, index, columns, dtype, copy)여기서 data, index, columns, dtype, copy 매개변수는 모두 선택 사항이며, 반드시 지정하지 않아도 됩니다.특히 딕셔너리의 리스트(li
데이터프레임(DataFrame)이란?데이터프레임은 행(row)과 열(column)로 이루어진 표 형태로 데이터를 저장하는 2차원 데이터 구조입니다. 관계형 데이터베이스의 SQL 테이블이나 엑셀 스프레드시트와 비슷한 모습이라고 생각하면 이해하기 쉽습니다.pandas 라이브러리에서는 다음 생성자를 사용해 데이터프레임을 만들 수 있습니다.pd.DataFrame(data, index, columns, dtype, copy)기존 데이터프레임에 새 열을 추가하는 방법은 여러 가지가 있습니다. 그중 대표적인 방법 하나는, 먼저 Series 데이
데이터프레임(DataFrame)은 데이터를 행(row)과 열(column)로 이루어진 표 형태로 저장하는 2차원 데이터 구조입니다. SQL의 데이터 테이블이나 엑셀 시트와 비슷한 형태로 시각화할 수 있으며, 다음과 같은 생성자를 통해 만들 수 있습니다.pd.Dataframe(data, index, columns, dtype, copy)이번 글에서는 Series의 딕셔너리(사전)를 활용해 데이터프레임을 생성하는 방법을 자세히 알아보겠습니다.Series란 무엇인가?Series는 파이썬 Pandas 라이브러리에 포함된 1차원 데이터 구조
데이터프레임(DataFrame)은 데이터를 행(row)과 열(column)의 표 형식으로 저장하는 2차원 데이터 구조입니다.SQL 테이블이나 엑셀 시트와 비슷한 형태로 시각화할 수 있으며, Python의 pandas 라이브러리에서 가장 핵심적으로 사용되는 자료 구조입니다. 데이터프레임에서 특정 열을 삭제하는 방법은 여러 가지가 있는데, 그중 하나가 바로 del 연산자를 사용하는 것입니다. del은 삭제할 열의 이름을 매개변수로 받아 해당 열을 제거합니다.예제 코드import pandas as pd my_data = {ab : pd.
데이터 시각화는 데이터 분석에서 매우 중요한 단계입니다. 복잡한 계산을 수행하거나 수많은 숫자를 일일이 살펴보지 않아도, 시각화를 통해 데이터 안에 숨겨진 패턴과 흐름을 직관적으로 파악할 수 있기 때문입니다. 또한 정량적인 인사이트를 청중에게 효과적으로 전달하는 데에도 큰 도움이 됩니다.Seaborn은 이러한 데이터 시각화를 손쉽게 구현할 수 있도록 도와주는 파이썬 라이브러리입니다. matplotlib을 기반으로 하며, 세련되게 디자인된 기본 테마와 고수준(high-level) 인터페이스를 제공해 몇 줄의 코드만으로도 아름다운 그래
데이터프레임(DataFrame)은 2차원 데이터 구조로, 데이터가 행과 열 형태의 표(tabular) 방식으로 저장됩니다.SQL 데이터 테이블이나 엑셀 스프레드시트와 비슷한 구조라고 생각하면 이해하기 쉽습니다. 데이터프레임에서 특정 열을 삭제하는 방법은 여러 가지가 있는데, 그중 하나가 바로 pop() 함수입니다.pop() 함수는 삭제하려는 열의 이름을 매개변수로 받아 해당 열을 제거하며, 삭제된 열을 Series 객체로 반환한다는 특징이 있습니다. 또한 drop() 메서드와 달리 원본 데이터프레임에서 직접 열을 제거하는 in-pl
데이터 분석 작업을 하다 보면 데이터프레임(DataFrame)에서 특정 열(column)의 합계를 구해야 하는 경우가 자주 발생합니다. 이럴 때 Pandas에서 제공하는 sum() 함수를 활용하면 아주 간단하게 해결할 수 있습니다.합계를 계산하고 싶은 열 이름을 대괄호([]) 안에 지정한 뒤 sum() 함수를 호출하면 해당 열의 전체 합계가 반환됩니다. 열의 인덱스 위치를 이용해 접근하는 방법도 가능합니다.그럼 실제 동작 과정을 예제를 통해 살펴보겠습니다.예제 코드import pandas as pd my_data = { N
데이터프레임(DataFrame)은 2차원 데이터 구조로, 데이터를 행과 열로 이루어진 표 형태로 저장합니다. SQL 데이터 테이블이나 엑셀 시트와 유사한 형태로 시각화할 수 있습니다. 데이터프레임은 다음과 같은 생성자를 사용하여 만들 수 있습니다. pd.DataFrame(data, index, columns, dtype, copy) 앞서 살펴본 방법에서는 새로운 열을 Series 데이터 구조로 생성한 뒤 원본 데이터프레임에 인덱싱하여 추가했습니다. 이번에는 이미 존재하는 열들을 활용해 새로운 열을 만드는 방법을 알아보겠습니다. 이
데이터 분석 작업을 하다 보면 특정 열의 평균값을 구하거나, 숫자 값을 포함하는 모든 열의 평균을 한 번에 계산해야 하는 경우가 종종 있습니다. 이럴 때 mean() 함수를 활용하면 간단하게 해결할 수 있습니다.여기서 말하는 평균(mean)이란 데이터셋에 있는 모든 값을 더한 뒤, 값의 총 개수로 나눈 결과를 의미합니다.그럼 실제 예제를 통해 살펴보겠습니다.예제 코드import pandas as pd my_data = {Name:pd.Series([Tom,Jane,Vin,Eve,Will]), Age:pd.Series([45, 67,
데이터 전처리(Data Pre-processing)란 다양한 소스 또는 단일 소스에서 수집된 모든 데이터를 공통 형식 또는 균일한 데이터셋(데이터 유형에 따라 다름)으로 정리하는 작업을 의미합니다. 실제 환경의 데이터는 결코 완벽하지 않기 때문에 누락된 셀, 오류, 이상치(outlier), 컬럼 간 불일치 등이 존재할 가능성이 높습니다. 경우에 따라서는 이미지가 올바르게 정렬되지 않았거나, 흐릿하거나, 크기가 지나치게 클 수도 있습니다. 전처리의 목표는 바로 이러한 불일치와 오류를 제거하는 것입니다.이미지의 해상도(resolutio
데이터 전처리란 무엇인가?데이터 전처리(pre-processing)란 다양한 소스 또는 단일 소스에서 수집한 모든 데이터를 공통 형식이나 균일한 데이터셋으로 정리하는 작업을 의미합니다.실제 환경에서 수집되는 데이터는 결코 이상적이지 않습니다. 따라서 데이터에 누락된 셀, 오류, 이상치(outlier), 열 간 불일치 등 다양한 문제가 존재할 가능성이 높습니다.이미지 역시 마찬가지입니다. 이미지가 올바르게 정렬되어 있지 않거나, 선명하지 않거나, 파일 크기가 지나치게 클 수 있습니다. 전처리의 목표는 바로 이러한 불일치와 오류를 제거
scikit-learn(흔히 sklearn이라고 불림)은 파이썬에서 머신러닝 알고리즘을 구현하기 위해 널리 사용되는 라이브러리입니다. 오픈소스로 공개되어 있어 누구나 무료로 사용할 수 있으며, NumPy, SciPy, Matplotlib 라이브러리를 기반으로 만들어졌습니다.이미지에서 윤곽선(컨투어)을 찾을 때는 마칭 스퀘어(marching squares) 방식이 사용됩니다. 이를 위해 skimage 라이브러리의 measure 모듈에 포함된 find_contours 함수를 활용합니다. 이 함수는 배열에 담긴 값들을 선형 보간(line
NumPy는 Numerical Python의 약자로, 다차원 배열 객체와 이를 효율적으로 처리할 수 있는 다양한 메서드를 제공하는 파이썬 라이브러리입니다. NumPy를 사용하면 배열에 대해 폭넓은 연산을 수행할 수 있으며, SciPy나 Matplotlib 같은 패키지와 함께 자주 활용됩니다. 특히 NumPy와 Matplotlib을 조합하면 MatLab의 대안으로 사용할 수 있을 만큼 강력합니다. NumPy는 오픈소스 패키지이기 때문에 누구나 자유롭게 사용할 수 있다는 장점도 있습니다.NumPy의 핵심 객체, ndarrayNumPy
의사결정 트리(Decision Tree)는 랜덤 포레스트(Random Forest) 알고리즘의 기본 구성 요소입니다. 머신러닝에서 가장 널리 사용되는 알고리즘 중 하나로, 주로 분류(Classification) 작업에 활용됩니다. 직관적이고 이해하기 쉬운 구조 덕분에 많은 개발자와 데이터 과학자에게 사랑받고 있습니다.의사결정 트리란 무엇인가?의사결정 트리가 내린 결정은 특정 예측이 왜 그렇게 도출되었는지 설명할 수 있습니다. 즉, 처리 과정의 입력과 출력이 사용자에게 명확하게 드러나는 것입니다. 또한 의사결정 트리는 배깅(Baggi
데이터 분석을 하다 보면 숫자형(numeric)으로 구성된 특정 열(column)의 평균값을 계산해야 하는 경우가 종종 발생합니다. 이럴 때 pandas에서 제공하는 mean 함수를 활용하면 아주 간단하게 해결할 수 있습니다.평균을 구하고자 하는 열을 데이터프레임에서 인덱싱한 뒤, 점(.) 연산자를 사용해 해당 열에 mean 함수를 호출하면 됩니다. 열 이름 대신 열의 인덱스 위치를 전달하여 평균을 구하는 것도 가능합니다. 여기서 mean()이란 데이터셋에 있는 모든 값의 합을 값의 총 개수로 나눈 값을 의미합니다.그럼 실제 예제를
표준편차(Standard Deviation)는 데이터셋 내 값들이 평균을 중심으로 얼마나 넓게 퍼져 있는지를 나타내는 대표적인 통계 지표입니다. 즉, 각 값이 해당 열의 산술 평균으로부터 얼마나 떨어져 있는지를 수치화하여 보여줍니다.데이터 분석 과정에서는 때때로 전체 데이터가 아닌, 숫자형으로 구성된 특정 열의 표준편차만 필요한 경우가 있습니다. 이럴 때 Pandas에서 제공하는 std() 함수를 활용하면 간단하게 해결할 수 있습니다.사용 방법은 매우 직관적입니다. 표준편차를 구하고자 하는 열 이름으로 데이터프레임을 인덱싱한 뒤,
데이터 분석을 할 때 다양한 함수를 적용하면 여러 유용한 정보를 얻을 수 있습니다. 하지만 데이터에 대한 전체적인 통계 정보를 한 번에 확인하고 싶다면 describe 함수를 사용하는 것이 가장 효과적입니다.이 함수는 개수(count), 평균(mean), 표준편차(standard deviation), 최솟값, 최댓값은 물론 25%, 50%(중앙값), 75% 백분위수까지 포함한 주요 기술 통계량을 자동으로 계산하여 보여줍니다. 덕분에 복잡한 코드 없이도 데이터의 분포와 특성을 빠르게 파악할 수 있습니다.예제 코드import panda
데이터 분석 작업을 하다 보면 데이터프레임(DataFrame)의 축(axis)을 따라 특정 함수를 적용해야 하는 경우가 자주 발생합니다. Pandas에서는 apply() 함수를 사용해 이를 손쉽게 처리할 수 있습니다.축(Axis)의 기본 동작축을 별도로 지정하지 않으면 기본적으로 열(column) 방향으로 연산이 수행되며, 이때 각 열은 하나의 배열처럼 취급됩니다. 반대로 axis=1과 같이 축을 명시적으로 지정하면 행(row) 방향으로 연산이 진행됩니다.apply() 함수는 점(.) 연산자를 통해 데이터프레임 객체에 직접 호출할