이 글에서는 AWS Glue 데이터 카탈로그에 등록된 크롤러의 스케줄러를 중지하는 방법을 알아봅니다.
예제 개요
AWS Glue 데이터 카탈로그에서 실행 중인 크롤러의 스케줄러를 중지하는 것이 목표입니다.
문제 정의: Python의 boto3 라이브러리를 사용하여 크롤러의 스케줄러를 중지합니다.
해결 접근 방식 및 알고리즘
1단계: 예외 처리를 위해 boto3와 botocore의 예외 모듈을 임포트합니다.
2단계: 이 함수에는 crawler_name(크롤러 이름)이 필수 파라미터로 필요합니다.
3단계: boto3 라이브러리를 사용해 AWS 세션을 생성합니다. 기본 프로파일에 region_name이 설정되어 있는지 확인하고, 설정되어 있지 않다면 세션 생성 시 명시적으로 region_name을 전달해야 합니다.
4단계: glue 서비스를 위한 AWS 클라이언트를 생성합니다.
5단계: stop_crawler_schedule 함수를 호출하면서 crawler_name을 CrawlerName 파라미터로 전달합니다.
6단계: 함수는 응답 메타데이터를 반환하며, 크롤러의 스케줄 상태를 NOT_SCHEDULED로 변경합니다. 단, 크롤러가 현재 실행 중인 경우에는 크롤러 자체가 중지되지 않습니다.
7단계: 스케줄러 중지 과정에서 오류가 발생할 경우 일반 예외(generic exception)를 처리합니다.
예제 코드
아래 코드는 크롤러의 스케줄러를 중지하는 예시입니다.
import boto3
from botocore.exceptions import ClientError
def stop_scheduler_of_a_crawler(crawler_name):
session = boto3.session.Session()
glue_client = session.client('glue')
try:
response = glue_client.stop_crawler_schedule(CrawlerName=crawler_name)
return response
except ClientError as e:
raise Exception("boto3 client error in stop_scheduler_of_a_crawler: " + e.__str__())
except Exception as e:
raise Exception("Unexpected error in stop_scheduler_of_a_crawler: " + e.__str__())
print(stop_scheduler_of_a_crawler("Data Dimension"))실행 결과
코드를 실행하면 다음과 같은 응답 메타데이터가 출력됩니다.
{'ResponseMetadata': {'RequestId': '73e50130-*****************8e', 'HTTPStatusCode': 200, 'HTTPHeaders': {'date': 'Sun, 28 Mar 2021 07:26:55 GMT', 'content-type': 'application/x-amz-json-1.1', 'content-length': '2', 'connection': 'keep-alive', 'x-amzn-requestid': '73e50130-***************8e'}, 'RetryAttempts': 0}}정리
boto3의 stop_crawler_schedule API를 사용하면 간단한 코드 몇 줄로 AWS Glue 데이터 카탈로그 내 크롤러의 스케줄링을 손쉽게 중지할 수 있습니다. HTTP 상태 코드 200이 반환되면 요청이 성공적으로 처리된 것입니다. 참고로 이 작업은 스케줄만 비활성화할 뿐, 이미 실행 중인 크롤러 작업 자체를 종료하지는 않으므로 유의해야 합니다.