Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

Boto3를 활용해 AWS Glue 데이터 카탈로그의 크롤러를 중지하는 방법

이 글에서는 boto3 라이브러리를 사용하여 AWS Glue Data Catalog에 등록된 크롤러(Crawler)가 실행 중일 때 이를 중지하는 방법을 단계별로 살펴봅니다.

문제 정의

Python에서 boto3 라이브러리를 활용하여 실행 중인 크롤러를 중지하는 것이 목표입니다.

해결 접근 방식 및 알고리즘

  • 1단계: 예외 처리를 위해 boto3botocore.exceptions 모듈을 임포트합니다.

  • 2단계: 함수의 매개변수로 crawler_name(크롤러 이름)을 전달받습니다.

  • 3단계: boto3 라이브러리를 사용해 AWS 세션을 생성합니다. 기본 프로필에 region_name이 설정되어 있지 않다면, 세션 생성 시 반드시 명시적으로 리전을 지정해야 합니다.

  • 4단계: glue 서비스를 위한 AWS 클라이언트 객체를 생성합니다.

  • 5단계: stop_crawler 함수를 호출하고, 매개변수 crawler_name을 Name 인자로 전달합니다.

  • 6단계: 크롤러가 실행 중이라면 응답 메타데이터를 반환하며 크롤러를 중지하고, 실행 중이 아니라면 CrawlerNotRunningException 예외가 발생합니다.

  • 7단계: 크롤러 중지 과정에서 문제가 발생한 경우를 대비해 일반 예외(generic exception)도 함께 처리합니다.

예제 코드

아래 코드는 지정된 크롤러를 중지하는 전체 예제입니다.

import boto3
from botocore.exceptions import ClientError

def stop_a_crawler(crawler_name):
    session = boto3.session.Session()
    glue_client = session.client('glue')
    try:
        response = glue_client.stop_crawler(Name=crawler_name)
        return response
    except ClientError as e:
        raise Exception("boto3 client error in stop_a_crawler: " + e.__str__())
    except Exception as e:
        raise Exception("Unexpected error in stop_a_crawler: " + e.__str__())

print(stop_a_crawler("Data Dimension"))

실행 결과

코드를 실행하면 아래와 같이 HTTP 상태 코드 200과 함께 응답 메타데이터가 반환되며, 해당 크롤러가 성공적으로 중지됩니다.

{'ResponseMetadata': {'RequestId': '73e50130-*****************8e', 'HTTPStatusCode': 200, 'HTTPHeaders': {'date': 'Sun, 28 Mar 2021 07:26:55 GMT', 'content-type': 'application/x-amz-json-1.1', 'content-length': '2', 'connection': 'keep-alive', 'x-amzn-requestid': '73e50130-***************8e'}, 'RetryAttempts': 0}}

마무리

boto3의 stop_crawler API를 사용하면 단 몇 줄의 코드로 AWS Glue 크롤러를 손쉽게 제어할 수 있습니다. 실무에서는 크롤러가 불필요하게 계속 실행되어 비용이 발생하지 않도록, 작업 완료 후 크롤러를 중지하거나 스케줄을 관리하는 것이 좋은 습관입니다. 또한 ClientError와 일반 예외를 분리하여 처리하면 오류 원인을 더 명확하게 파악할 수 있습니다.