Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

파이썬 NumPy chebfit() 함수로 데이터에 대한 체비셰프 급수 최소제곱 피팅하기

데이터에 대한 체비셰프(Chebyshev) 급수의 최소제곱 피팅을 구하려면 파이썬 NumPy에서 제공하는 numpy.polynomial.chebyshev 모듈의 chebfit() 메서드를 사용하면 됩니다. 이 메서드는 낮은 차수부터 높은 차수 순서대로 정렬된 체비셰프 계수를 반환합니다. 만약 y가 2차원 배열이라면, y의 k번째 열에 있는 데이터에 대한 계수가 결과의 k번째 열에 위치하게 됩니다.

이 메서드는 다양한 매개변수를 지원하며, 각 매개변수의 역할은 다음과 같습니다.

주요 매개변수 설명

x — M개의 샘플(데이터) 점 (x[i], y[i])에 대한 x 좌표입니다.

y — 샘플 점들의 y 좌표입니다. 동일한 x 좌표를 공유하는 여러 세트의 샘플 점을 한 번의 호출로 (독립적으로) 피팅하려면, 각 데이터 세트를 하나의 열에 담은 2차원 배열을 y로 전달하면 됩니다.

deg — 피팅에 사용할 다항식의 차수입니다. deg가 단일 정수인 경우, deg 차항까지의 모든 항이 피팅에 포함됩니다.

rcond — 피팅의 상대 조건수입니다. 가장 큰 특이값에 상대적으로 rcond보다 작은 특이값은 무시됩니다. 기본값은 len(x)*eps이며, 여기서 eps는 플랫폼 float 타입의 상대 정밀도로 대부분의 경우 약 2e-16입니다.

full — 반환 값의 성격을 결정하는 스위치입니다. False(기본값)일 때는 계수만 반환되고, True일 때는 특이값 분해(SVD)에서 얻은 진단 정보도 함께 반환됩니다.

w — 가중치입니다. None이 아닌 경우, 가중치 w[i]는 x[i]에서의 비제곱 잔차 y[i] - ŷ[i]에 적용됩니다. 이상적으로는 w[i]*y[i] 곱들의 오차가 모두 동일한 분산을 갖도록 가중치를 선택해야 합니다. 역분산 가중치 방식을 사용할 때는 w[i] = 1/sigma(y[i])로 설정합니다. 기본값은 None입니다.

구현 단계

먼저 필요한 라이브러리를 임포트합니다.

import numpy as np
from numpy.polynomial import chebyshev as C

x 좌표를 생성합니다. -1부터 1까지 51개의 균등한 점을 만듭니다.

x = np.linspace(-1,1,51)

x 좌표를 출력하여 확인합니다.

print("X Co-ordinate...\n",x)

y 좌표를 생성합니다. 여기에는 3차 함수 x³ − x에 무작위 노이즈(np.random.randn)를 더했습니다.

y = x**3 - x + np.random.randn(len(x))
print("\nY Co-ordinate...\n",y)

데이터에 대한 체비셰프 급수의 최소제곱 피팅을 구하기 위해 chebfit()을 호출합니다. full=True 옵션을 사용했으므로 진단 정보도 함께 반환됩니다.

c, stats = C.chebfit(x,y,3,full=True)
print("\nResult...\n",c)
print("\nResult...\n",stats)

전체 예제 코드

import numpy as np
from numpy.polynomial import chebyshev as C

# x 좌표 생성
x = np.linspace(-1,1,51)

# x 좌표 출력
print("X Co-ordinate...\n",x)

# y 좌표 생성 (노이즈 포함)
y = x**3 - x + np.random.randn(len(x))
print("\nY Co-ordinate...\n",y)

# 체비셰프 급수 최소제곱 피팅 수행
c, stats = C.chebfit(x,y,3,full=True)

print("\nResult...\n",c)

print("\nResult...\n",stats)

실행 결과

X Co-ordinate...
   [-1. -0.96 -0.92 -0.88 -0.84 -0.8 -0.76 -0.72 -0.68 -0.64 -0.6 -0.56
       -0.52 -0.48 -0.44 -0.4 -0.36 -0.32 -0.28 -0.24 -0.2 -0.16 -0.12 -0.08
       -0.04 0. 0.04 0.08 0.12 0.16 0.2 0.24 0.28 0.32 0.36 0.4
        0.44 0.48 0.52 0.56 0.6 0.64 0.68 0.72 0.76 0.8 0.84 0.88
        0.92 0.96 1. ]

   Y Co-ordinate...
   [   0.04578661 -0.41009751 -0.59839355 -0.86942574  1.19418042 -0.53671972
      -0.71247683  0.7118818  -0.09274183  1.46114141 -0.40189463 -0.84017206
      -1.00618725 -0.7191427  -0.48005631 -0.28661328  0.58161734  2.62382626
      -0.56256678  0.92925678  1.68074305  0.97381262  1.22568804  1.71884192
       1.03080843  0.55990935  0.29117168 -0.63718482  0.49396313 -0.32920431
       1.16682261  0.90746863 -1.0058597   0.54972961 -1.06040041 -0.11828954
      -0.51446299 -1.97932024 -0.91902371 -0.31859977 -1.16124938  0.31809796
       0.54940462 -1.11008331  1.04918751 -2.60742632 -1.07242746  0.54313779
      -0.3440979  -0.28234564  0.46429998]

Result...
   [-0.12730537 -0.08699379 -0.4211565 0.32959334]

Result...
   [array([43.34485511]), 4, array([1.20144978, 1.19227163, 0.76058422, 0.74600162]), 1.1324274851176597e-14]

결과 해석

실행 결과를 살펴보면, c 배열에는 피팅된 3차 체비셰프 다항식의 계수 4개가 담겨 있습니다. stats 배열에는 진단 정보가 포함되어 있는데, 첫 번째 요소는 최소제곱 오차(잔차의 제곱합), 두 번째 요소는 피팅의 랭크(rank), 세 번째 요소는 특이값들, 네 번째 요소는 피팅의 상대 조건수입니다. 이처럼 full=True 옵션을 활용하면 단순히 계수만 얻는 것이 아니라 피팅 품질을 평가할 수 있는 유용한 정보를 함께 확인할 수 있습니다.