개요
AWS 환경에서 ETL 작업을 관리하다 보면 계정에 등록된 모든 크롤러(Crawler) 목록을 한 번에 확인해야 하는 경우가 자주 발생합니다. 이 글에서는 Python의 boto3 라이브러리를 사용하여 AWS Glue 데이터 카탈로그에 존재하는 모든 크롤러의 목록을 조회하는 방법을 단계별로 살펴보겠습니다.
문제 정의
문제: Python에서 boto3 라이브러리를 활용하여 AWS 계정 내 모든 크롤러의 목록을 가져옵니다.
해결 접근 방법
1단계: 예외 처리를 위해 boto3와 botocore의 예외 클래스를 임포트합니다.
2단계: 이 함수는 별도의 파라미터가 필요하지 않습니다.
3단계: boto3 라이브러리를 사용하여 AWS 세션을 생성합니다. 기본 프로파일에 region_name이 설정되어 있는지 확인하고, 설정되어 있지 않다면 세션 생성 시 region_name을 명시적으로 전달해야 합니다.
4단계: glue 서비스를 위한 AWS 클라이언트 객체를 생성합니다.
5단계: list_crawlers 함수를 호출합니다.
6단계: 해당 함수는 AWS Glue 데이터 카탈로그에 존재하는 모든 크롤러의 목록을 반환합니다.
7단계: 작업 수행 중 오류가 발생할 경우를 대비해 일반 예외(generic exception) 처리 로직을 추가합니다.
예제 코드
아래 코드는 AWS 계정의 전체 크롤러 목록을 가져옵니다.
import boto3
from botocore.exceptions import ClientError
def list_of_crawlers():
session = boto3.session.Session()
glue_client = session.client('glue')
try:
crawler_details = glue_client.list_crawlers()
return crawler_details
except ClientError as e:
raise Exception("boto3 client error in list_of_crawlers: " + e.__str__())
except Exception as e:
raise Exception("Unexpected error in list_of_crawlers: " + e.__str__())
print(list_of_crawlers())
실행 결과
{'CrawlerNames': ['crawler_for_s3_file_job', 'crawler_for_employee_data', 'crawler_for_security_data'], 'ResponseMetadata': {'RequestId': 'a498ba4a-7ba4-47d3-ad81-d86287829c1d', 'HTTPStatusCode': 200, 'HTTPHeaders': {'date': 'Sat, 13 Feb 2021 14:04:03 GMT', 'content-type': 'application/x-amz-json-1.1', 'content-length': '830', 'connection': 'keep-alive', 'x-amzn-requestid': 'a498ba4a-7ba4-47d3-ad81-d86287829c1d'}, 'RetryAttempts': 0}}결과 해석
응답 결과의 CrawlerNames 키에는 조회된 크롤러 이름들이 리스트 형태로 포함되어 있습니다. 위 예시에서는 crawler_for_s3_file_job, crawler_for_employee_data, crawler_for_security_data 세 개의 크롤러가 반환되었으며, HTTP 상태 코드 200은 API 호출이 성공적으로 완료되었음을 의미합니다.
또한 ClientError와 일반 Exception을 분리하여 처리함으로써, AWS API 호출 과정에서 발생하는 오류와 그 외 예기치 않은 오류를 구분해 디버깅 효율을 높일 수 있습니다.