이 글에서는 boto3 라이브러리를 사용하여 AWS Glue Data Catalog에서 워크플로(Workflow)를 시작하는 방법을 단계별로 살펴보겠습니다.
문제 정의
과제: Python의 boto3 라이브러리를 활용하여 AWS Glue 워크플로를 실행합니다.
해결 접근 방식 및 알고리즘
1단계: 예외 처리를 위해 boto3와 botocore 예외 모듈을 임포트합니다.
2단계: 함수의 매개변수로 workflow_name(워크플로 이름)을 받습니다.
3단계: boto3 라이브러리를 사용하여 AWS 세션을 생성합니다. 기본 프로필에 region_name이 설정되어 있는지 확인하고, 설정되어 있지 않다면 세션 생성 시 region_name을 명시적으로 전달해야 합니다.
4단계: glue 서비스를 위한 AWS 클라이언트를 생성합니다.
5단계: start_workflow_run 함수를 호출하면서 매개변수 workflow_name을 Name 인자로 전달합니다.
6단계: 워크플로가 시작되면 RunId와 응답 메타데이터(ResponseMetadata)가 반환됩니다.
7단계: 워크플로 시작 중 문제가 발생할 경우 일반 예외(generic exception)를 처리합니다.
예제 코드
다음 코드는 워크플로를 시작하는 예시입니다.
import boto3
from botocore.exceptions import ClientError
def start_a_workflow(workflow_name):
session = boto3.session.Session()
glue_client = session.client('glue')
try:
response = glue_client.start_workflow_run(Name=workflow_name)
return response
except ClientError as e:
raise Exception("boto3 client error in start_a_workflow: " + e.__str__())
except Exception as e:
raise Exception("Unexpected error in start_a_workflow: " + e.__str__())
print(start_a_workflow("test-daily"))
실행 결과
코드를 실행하면 아래와 같이 워크플로 실행 ID(RunId)와 응답 메타데이터가 반환됩니다.
{'RunId': 'wr_64e880240692fddd5e1b19aed587f856bc20a96f54bc', 'ResponseMetadata': {'RequestId': '782e953b-8ee3-4876-9b2c-cd35e147b513', 'HTTPStatusCode': 200, 'HTTPHeaders': {'date': 'Sun, 28 Mar 2021 08:11:02 GMT', 'content-type': 'application/x-amz-json-1.1', 'content-length': '79', 'connection': 'keep-alive', 'x-amzn-requestid': '782e953b-********************************13'}, 'RetryAttempts': 0}}정리
boto3의 start_workflow_run API를 사용하면 몇 줄의 코드만으로 AWS Glue Data Catalog의 워크플로를 손쉽게 실행할 수 있습니다. ClientError와 일반 예외를 구분하여 처리하면 오류 발생 시 원인을 더 명확하게 파악할 수 있다는 점도 기억하세요.