Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

Python

  1. Python pandas로 상위 2개 값과 하위 2개 값의 Id·Age 열 백분율 변화 계산하기

    문제 개요 데이터프레임이 주어졌을 때, Id와 Age 열에 대해 상위 2개 값(top 2)과 하위 2개 값(bottom 2)의 백분율 변화(percentage change)를 계산하는 방법을 알아보겠습니다. 최종적으로 얻고자 하는 결과는 다음과 같습니다. Id와 Age - 상위 2개 값 Id Age 0 NaN NaN 1 1.0 0.0 Id와 Age - 하위 2개 값 Id Age 3 0.000000 -0.071429 4 0.666667 0.000000 해결 방법 이 문제는 pandas의 pct_cha

  2. 파이썬 applymap() 함수로 데이터프레임 전체 열의 요소 길이 구하기

    판다스(Pandas)에서 applymap() 함수를 사용하면 데이터프레임의 모든 셀에 동일한 연산을 한 번에 적용할 수 있습니다. 이번 글에서는 applymap()과 람다(lambda) 함수를 조합하여 데이터프레임의 모든 열에 있는 각 요소의 문자열 길이를 계산하고 출력하는 방법을 알아보겠습니다.실행 결과 미리 보기과일(Fruits)과 도시(City) 두 개의 열로 구성된 데이터프레임이 있을 때, 각 요소의 길이를 구하면 다음과 같은 결과를 얻을 수 있습니다.Dataframe is: Fruits City 0 Ap

  3. 파이썬 Pandas로 두 데이터프레임의 교차표(Crosstab) 구하기

    데이터 분석에서 교차표(cross-tabulation)는 두 개 이상의 변수 간 빈도 관계를 한눈에 파악할 수 있게 해주는 유용한 도구입니다. 판다스(pandas)의 pd.crosstab() 함수를 사용하면 서로 다른 데이터프레임에 있는 열들을 조합해 손쉽게 교차표를 만들 수 있습니다.예를 들어, 두 개의 데이터프레임이 있다고 가정하고 교차표를 적용하면 다음과 같은 결과를 얻습니다.Age 12 13 14 Mark 80 90 85 Id 1 1 0 0 2 0 1 0 3 1 0

  4. Pandas 데이터프레임에서 축(Axis) 이름을 변경하는 Python 코드 작성 방법

    데이터프레임을 다룰 때, 때로는 행(row)이나 열(column)에 해당하는 축(axis) 자체에 이름을 지정해야 할 필요가 있습니다. 예를 들어, 다음과 같은 데이터프레임이 있고 열 방향 축의 이름을 index로 변경하고 싶다고 가정해 보겠습니다.Rename index: index Id Age Mark 0 1.0 12.0 80.0 1 2.0 12.0 90.0 2 3.0 14.0 NaN 3 NaN 13.0 95.

  5. Python Pandas interpolate()로 데이터프레임의 누락된 값(NaN) 채우기

    Pandas로 누락된 값(NaN) 처리하기 데이터 분석을 하다 보면 수집 과정에서 발생한 결측값(누락된 값, NaN)을 자주 만나게 됩니다. Pandas에서 제공하는 interpolate() 함수를 사용하면 선형 보간(linear interpolation) 기법을 통해 이러한 결측값을 자연스럽게 채울 수 있습니다. 이번 글에서는 주어진 데이터프레임에서 모든 누락된 값을 채우는 Python 코드를 살펴보겠습니다. 해결 방법 다음 단계를 따라 문제를 해결할 수 있습니다. 결측값을 포함하는 데이터프레임을 정의합니다. df.interp

  6. 파이썬으로 데이터프레임의 조정된(Adjusted) EWM과 비조정(Non-adjusted) EWM 계산하기

    데이터 분석에서 지수 가중 평균(EWM, Exponentially Weighted Mean)은 최근 데이터에 더 큰 가중치를 부여하는 이동 평균 기법입니다. 판다스(pandas)의 ewm() 메서드는 adjust 매개변수를 통해 두 가지 방식의 계산을 지원합니다.예를 들어, 다음과 같은 데이터프레임이 있을 때 조정된(adjusted) EWM과 비조정(non-adjusted) EWM의 결과는 각각 아래와 같습니다.adjusted ewm: Id Age 0 1.000000 12.000000 1 1.750000 12

  7. 파이썬으로 데이터프레임 행을 튜플 리스트 형태의 OrderedDict로 출력하는 방법

    데이터 분석 작업을 하다 보면 pandas 데이터프레임의 각 행을 OrderedDict 형태로 변환해야 하는 경우가 종종 있습니다. 이 글에서는 데이터프레임의 행들을 튜플 리스트가 포함된 OrderedDict로 변환하여 출력하는 방법을 단계별로 알아보겠습니다.예를 들어, 다음과 같은 데이터프레임이 있고 이를 OrderedDict로 변환하면 아래와 같은 결과를 얻을 수 있습니다.OrderedDict([(Index, 0), (Name, Raj), (Age, 13), (City, Chennai), (Mark, 80)]) OrderedDi

  8. 파이썬으로 데이터프레임 레코드를 C 순서와 F 순서로 평탄화하는 방법

    데이터프레임이 하나 있고, 이를 C 순서(C order)와 F 순서(F order)로 평탄화(flatten)한 결과가 다음과 같다고 가정해 보겠습니다. flat c_order: [10 12 25 13 3 12 11 14 24 15 6 14] flat F_order: [10 25 3 11 24 6 12 13 12 14 15 14] 여기서 C 순서는 행 우선(row-major) 방식으로 각 행의 값을 차례대로 읽어 나가는 것이고, F 순서는 열 우선(column-major) 방식으로 각 열의 값을 차례대로 읽어 나가는

  9. 파이썬으로 시작일과 종료일 사이의 총 영업일 수 계산하기

    개요데이터 분석이나 프로젝트 일정 관리를 하다 보면 특정 기간 동안의 영업일(평일) 수가 몇 일인지 계산해야 하는 경우가 자주 발생합니다. 이 글에서는 파이썬의 pandas 라이브러리를 활용해 시작 날짜와 종료 날짜 사이의 총 영업일 수를 구하는 함수를 작성하는 두 가지 방법을 소개합니다.예를 들어, 2020-01-01부터 2020-02-02까지의 영업일 범위를 생성하면 주말이 제외된 다음과 같은 날짜 목록을 얻을 수 있습니다.Dates are: DatetimeIndex([2020-01-01, 2020-01-02, 2020-01-0

  10. Python으로 데이터프레임에서 결측치가 가장 적은 열 찾기

    데이터프레임이 주어져 있고, 그중에서 결측치(NaN)의 개수가 가장 적은 열을 찾아야 하는 상황을 가정해 보겠습니다. 원하는 결과는 다음과 같습니다.DataFrame is: Id Salary Age 0 1.0 20000.0 22.0 1 2.0 NaN 23.0 2 3.0 50000.0 NaN 3 NaN 40000.0 25.0 4 5.0 80000.0 NaN 5 6.0 NaN 25.0 6 7.0 350000.0 26.0 7 8.0 55

  11. 파이썬으로 데이터프레임 각 열에서 두 번째로 낮은 값 찾는 방법

    문제 개요pandas로 데이터 분석을 하다 보면 데이터프레임의 각 열에서 최솟값뿐만 아니라 두 번째로 낮은 값을 찾아야 하는 경우가 있습니다. 예를 들어 다음과 같은 결과를 얻고자 하는 것입니다.Id 2 Salary 30000 Age 23즉, Id 열에서는 2, Salary 열에서는 30000, Age 열에서는 23이 각각 두 번째로 낮은 값입니다.해결 방법이 문제는 df.apply() 함수와 lambda 표현식을 조합하면 간단하게 해결할 수 있습니다. 단계별로 살펴보겠습니다.먼저 데이터프레임을 정의합니다.df.a

  12. Python으로 1~100 사이 무작위 값 30개 데이터프레임 생성 후 각 행의 최댓값÷최솟값 계산하기

    이 글에서는 Python의 pandas와 numpy를 활용해 1부터 100 사이의 무작위 정수 30개로 데이터프레임을 생성한 뒤, 각 행(row)별로 최댓값 ÷ 최솟값을 계산하는 방법을 소개합니다.실행 결과 미리 보기각 행의 최댓값을 최솟값으로 나눈 결과는 다음과 같습니다.0 43.000000 1 1.911111 2 2.405405 3 20.000000 4 7.727273 5 6.333333그럼 해결 절차를 단계별로 살펴보겠습니다.해결 방법1단계: 데이터프레임 생성numpy의 np.random

  13. 파이썬으로 시계열 데이터에서 처음과 마지막 3일 출력하는 방법

    시계열 데이터가 있을 때, 주어진 시리즈에서 처음 3일과 마지막 3일의 데이터를 추출하여 출력하는 결과는 다음과 같습니다.first three days: 2020-01-01 Chennai 2020-01-03 Delhi Freq: 2D, dtype: object last three days: 2020-01-07 Pune 2020-01-09 Kolkata Freq: 2D, dtype: object이 문제를 해결하기 위해 아래 단계를 순서대로 따라가 보겠습니다.해결 방법먼저 시리즈(Series)를 정의하고 변수 da

  14. 파이썬에서 구분자를 기준으로 문자열을 나누고 판다스 시리즈로 변환하는 함수 작성하기

    문제 개요하나의 문자열을 특정 구분자(delimiter)를 기준으로 분할한 뒤, 그 결과를 판다스(pandas)의 시리즈(Series) 객체로 변환하면 아래와 같은 형태의 결과를 얻을 수 있습니다.0 apple 1 orange 2 mango 3 kiwi이번 글에서는 이 문제를 해결하는 두 가지 방법을 단계별로 살펴보겠습니다.해결 방법 1: 사용자 정의 함수 활용split_str() 함수를 정의하고, 문자열(s)과 구분자(d) 두 개의 인자를 받도록 합니다.함수 내부에서 s.split(d)를 호출해 분할된

  15. 파이썬과 TensorFlow로 딥러닝 훈련 결과 시각화하기 – matplotlib 활용 가이드

    TensorFlow로 학습시킨 모델의 훈련 결과는 파이썬의 matplotlib 라이브러리를 활용해 손쉽게 시각화할 수 있습니다. 특히 plot() 메서드를 사용하면 에포크(epoch)별 정확도와 손실의 변화 추이를 그래프로 한눈에 확인할 수 있어, 모델의 학습 상태를 진단하는 데 매우 유용합니다.사전 이해: Keras Sequential API와 CNN이 예제는 Keras Sequential API를 사용합니다. Sequential 모델은 레이어를 순차적으로 쌓아 올리는 구조로, 각 레이어가 정확히 하나의 입력 텐서와 하나의 출력

  16. TensorFlow와 Python으로 데이터 증강을 활용해 과적합(Overfitting) 줄이는 방법

    데이터 증강(Data Augmentation)은 기존 학습 데이터에 무작위 변형을 가해 사실적으로 보이는 새로운 학습 데이터를 추가함으로써 과적합(Overfitting)을 줄이는 효과적인 기법입니다. Keras에서는 RandomFlip 레이어 등을 포함하는 Sequential 모델을 구성해 이를 간단히 구현할 수 있습니다.Keras Sequential API와 CNN이 글에서는 Keras Sequential API를 사용합니다. Sequential API는 평범한 레이어 스택(stack) 형태로 모델을 구성할 때 특히 유용하며, 각

  17. Pandas 시리즈 각 요소에서 부분 문자열 추출하기 – Python 슬라이싱 두 가지 방법

    Pandas 시리즈(Series)에 담긴 문자열 데이터에서 특정 위치의 문자만 골라내야 할 때가 자주 있습니다. 예를 들어 아래와 같은 시리즈가 있을 때, 각 요소에서 일정한 간격으로 문자를 추출하면 다음과 같은 결과를 얻습니다.0    Ap 1    Oa 2    Mn 3    Kw이 글에서는 이 문제를 해결하는 두 가지 방법을 소개합니다. 해결 방법 1: str.slice() 함수 사용 str.slice()는 Pandas

  18. 파이썬 Pandas로 데이터프레임의 롤링 윈도우 평균 계산하기

    Pandas에서 롤링(Rolling) 윈도우는 시계열 데이터나 연속된 관측값을 분석할 때 널리 활용되는 기법입니다. 고정된 크기의 창을 한 칸씩 이동시키면서 각 구간의 통계값을 계산하기 때문에 이동 평균(moving average)이라고도 부릅니다. 예를 들어 다음과 같은 데이터프레임에 롤링 윈도우 평균을 적용하면 아래와 같은 결과를 얻을 수 있습니다. Average of rolling window is: Id Age Mark 0 NaN NaN NaN 1 1.5 12.0 85.0 2 2.5 13.

  19. Python Pandas factorize()로 고유값을 정렬한 숫자형 인덱스 배열 출력하기

    데이터 분석 과정에서 문자열로 구성된 리스트나 시리즈를 숫자형 인덱스로 변환해야 하는 경우가 종종 있습니다. 예를 들어 다음과 같은 과일 이름 리스트가 있고, 각 고유값에 알파벳순으로 정렬된 숫자형 인덱스를 부여한다고 가정해 보겠습니다. Sorted distinct values - numeric array index [2 3 0 3 2 1 4] [apple kiwi mango orange pomegranate] 이 문제는 pandas의 pd.factorize() 함수를 활용하면 간단하게 해결할 수 있습니다. 아래 단계를 따라 살펴

  20. 파이썬 판다스(Pandas) datetime 열에서 날짜와 시간 분리하는 방법

    데이터 분석을 하다 보면 데이터프레임의 datetime 열에서 날짜(date)와 시간(time)을 각각 분리해야 하는 경우가 자주 발생합니다. 예를 들어 아래와 같이 datetime 열 하나만 있는 데이터프레임이 있을 때,    datetime    date          time 0 2020-01-01 07:00:00 2020-01-06 07:00:00 1 2020-01

Total 8989 -컴퓨터  FirstPage PreviousPage NextPage LastPage CurrentPage:232/450  20-컴퓨터/Page Goto:1 226 227 228 229 230 231 232 233 234 235 236 237 238