Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

Boto3로 AWS Glue 데이터 카탈로그 크롤러 스케줄러 시작하기

이 글에서는 AWS Glue Data Catalog에 등록된 크롤러의 스케줄러를 시작하는 방법을 알아보겠습니다. Python의 boto3 라이브러리를 활용하면 몇 줄의 코드만으로 크롤러 일정을 손쉽게 관리할 수 있습니다.

문제 상황

AWS Glue Data Catalog에 존재하는 크롤러의 스케줄러를 시작해야 하는 상황을 가정해 보겠습니다. Python에서 boto3 라이브러리를 사용하여 크롤러의 스케줄러를 시작하는 것이 목표입니다.

해결 접근 방식

  • 1단계: 예외 처리를 위해 boto3botocore의 예외 클래스를 임포트합니다.
  • 2단계: 이 함수에는 crawler_name(크롤러 이름)이 필수 파라미터로 필요합니다.
  • 3단계: boto3 라이브러리를 사용하여 AWS 세션을 생성합니다. 기본 프로필에 region_name이 설정되어 있는지 확인하고, 설정되어 있지 않다면 세션 생성 시 명시적으로 region_name을 전달해야 합니다.
  • 4단계: glue 서비스를 위한 AWS 클라이언트를 생성합니다.
  • 5단계: start_crawler_schedule 함수를 호출하고, CrawlerName 파라미터에 crawler_name을 전달합니다.
  • 6단계: 호출이 성공하면 응답 메타데이터가 반환되며, 크롤러의 일정 상태가 SCHEDULED로 설정됩니다. 만약 크롤러가 이미 실행 중이거나 일정 상태가 이미 SCHEDULED라면 SchedulerRunningException 예외가 발생합니다.
  • 7단계: 스케줄러 시작 과정에서 문제가 발생한 경우를 대비하여 일반 예외도 함께 처리합니다.

예제 코드

다음 코드는 크롤러의 스케줄러를 시작하는 예시입니다.

import boto3
from botocore.exceptions import ClientError

def start_scheduler_of_a_crawler(crawler_name):
    session = boto3.session.Session()
    glue_client = session.client('glue')
    try:
        response = glue_client.start_crawler_schedule(CrawlerName=crawler_name)
        return response
    except ClientError as e:
        raise Exception("boto3 client error in start_scheduler_of_a_crawler: " + e.__str__())
    except Exception as e:
        raise Exception("Unexpected error in start_scheduler_of_a_crawler: " + e.__str__())

print(start_scheduler_of_a_crawler("Data Dimension"))

실행 결과

코드를 실행하면 다음과 같은 응답 메타데이터가 출력됩니다.

{'ResponseMetadata': {'RequestId': '73e50130-*****************8e', 'HTTPStatusCode': 200, 'HTTPHeaders': {'date': 'Sun, 28 Mar 2021 07:26:55 GMT', 'content-type': 'application/x-amz-json-1.1', 'content-length': '2', 'connection': 'keep-alive', 'x-amzn-requestid': '73e50130-***************8e'}, 'RetryAttempts': 0}}

HTTP 상태 코드 200이 반환되면 스케줄러가 성공적으로 시작된 것입니다. 이후 크롤러는 설정된 일정에 따라 자동으로 실행됩니다.