배열에서 최대값을 구하거나, NaN(Not a Number) 값을 제외한 나머지 요소 중 최대값을 구하려면 Python의 numpy.nanmax() 메서드를 사용하면 됩니다.
이 메서드는 입력 배열 a와 같은 형태(shape)를 가지되, 지정된 축(axis)이 제거된 배열을 반환합니다. 만약 a가 0차원 배열이거나 axis가 None이면 ndarray 스칼라 값이 반환되며, 입력 배열과 동일한 dtype이 유지됩니다.
numpy.nanmax()의 주요 매개변수
1. a (필수)
최대값을 구하고자 하는 숫자들을 담고 있는 배열입니다. 배열이 아닌 값이 전달되면 자동으로 배열로 변환을 시도합니다.
2. axis
최대값을 계산할 축 또는 축들의 집합입니다. 기본값은 None으로, 이 경우 평탄화(flattened)된 배열 전체에 대한 최대값이 계산됩니다.
3. out
결과를 저장할 대체 출력 배열입니다. 기본값은 None이며, 값을 지정할 경우 예상 출력과 동일한 shape을 가져야 합니다. 필요시 타입은 자동으로 캐스팅(casting)됩니다.
4. keepdims
True로 설정하면, 연산 후 차원이 축소된 축들이 크기 1인 차원으로 결과에 유지됩니다. 이 옵션을 사용하면 원본 배열 a와 올바르게 브로드캐스팅(broadcasting)됩니다. 기본값 외의 값이 지정되면 keepdims는 ndarray 하위 클래스의 max 메서드에 그대로 전달되는데, 하위 클래스 메서드가 keepdims를 구현하지 않으면 예외가 발생할 수 있습니다.
5. minimum
출력 요소의 최솟값입니다. 빈 슬라이스(empty slice)에 대한 연산을 허용하기 위해 반드시 존재해야 하는 매개변수입니다.
구현 단계
먼저 필요한 라이브러리를 임포트합니다.
import numpy as np
array() 메서드를 사용하여 NumPy 배열을 생성합니다. 여기에는 int 타입 요소와 함께 nan 값도 포함되어 있습니다.
arr = np.array([[10, 20, 30], [40, np.nan, 60]])
배열을 화면에 출력합니다.
print("Our Array...\n",arr)배열의 차원을 확인합니다.
print("\nDimensions of our Array...\n",arr.ndim)배열의 데이터타입(dtype)을 확인합니다.
print("\nDatatype of our Array object...\n",arr.dtype)NaN을 무시하고 최대값을 반환하기 위해 numpy.nanmax() 메서드를 사용합니다. 앞서 설명했듯이, 이 메서드는 지정된 축이 제거된 형태의 배열을 반환하며, 0차원 배열이거나 axis가 None일 경우 ndarray 스칼라를 반환합니다.
print("\nResult (nanmax)...\n",np.nanmax(arr))전체 예제 코드
import numpy as np
# array() 메서드를 사용해 NumPy 배열 생성
# int 타입 요소와 nan 값이 포함되어 있음
arr = np.array([[10, 20, 30], [40, np.nan, 60]])
# 배열 출력
print("Our Array...\n",arr)
# 차원 확인
print("\nDimensions of our Array...\n",arr.ndim)
# 데이터타입 확인
print("\nDatatype of our Array object...\n",arr.dtype)
# numpy.nanmax() 메서드로 NaN을 무시한 최대값 계산
print("\nResult (nanmax)...\n",np.nanmax(arr))실행 결과
Our Array... [[10. 20. 30.] [40. nan 60.]] Dimensions of our Array... 2 Datatype of our Array object... float64 Result (nanmax)... 60.0
실행 결과를 보면, 배열에 NaN 값이 포함되어 있음에도 불구하고 np.nanmax()가 이를 정상적으로 무시하고 나머지 요소 중 최대값인 60.0을 반환한 것을 확인할 수 있습니다. 참고로 일반적인 np.max()를 사용했다면 NaN 때문에 결과 역시 NaN이 되었을 것이므로, 결측치가 있는 데이터를 다룰 때는 nanmax()가 매우 유용합니다.