이 글에서는 Python의 boto3 라이브러리를 사용하여 AWS Glue에 등록된 특정 작업(Job)의 모든 작업 실행(Job Run) 기록을 페이지 단위로 조회하는 방법을 알아봅니다.
문제 정의
과제: Python의 boto3 라이브러리를 사용해, 본인 계정의 AWS Glue Data Catalog에 생성된 작업의 실행 이력을 페이지네이션 방식으로 조회합니다.
해결 접근 방식 및 알고리즘
1단계: 예외 처리를 위해 boto3와 botocore.exceptions를 임포트합니다.
2단계: 함수의 선택적 파라미터는 max_items, page_size, starting_token이며, job_name은 필수 파라미터입니다.
max_items: 반환할 레코드의 총 개수를 의미합니다. 사용 가능한 레코드 수가 max_items보다 많으면, 응답에 NextToken이 포함되어 페이지네이션을 이어갈 수 있습니다.
page_size: 한 페이지당 포함될 레코드의 크기를 나타냅니다.
starting_token: 페이지네이션을 재개할 때 사용하며, 이전 응답에서 받은 NextToken 값을 전달합니다.
3단계: boto3 라이브러리로 AWS 세션을 생성합니다. 기본 프로파일에 region_name이 설정되어 있지 않다면, 세션 생성 시 명시적으로 리전 이름을 전달해야 합니다.
4단계: Glue 서비스를 위한 AWS 클라이언트를 생성합니다.
5단계: get_job_runs API를 사용해 모든 작업 실행 정보를 담는 paginator(페이지네이터) 객체를 생성합니다.
6단계: paginate 함수를 호출하고, max_items, page_size, starting_token을 PaginationConfig 파라미터로 전달합니다.
7단계: max_size와 page_size 설정에 따라 해당 개수만큼의 레코드가 반환됩니다.
8단계: 페이지네이션 과정에서 오류가 발생할 경우 일반 예외(generic exception)를 처리합니다.
예제 코드
아래 코드를 사용하면 사용자 계정에 생성된 작업의 모든 실행 이력을 페이지 단위로 조회할 수 있습니다.
import boto3
from botocore.exceptions import ClientError
def paginate_through_jobruns(job_name, max_items=None:int, page_size=None:int, starting_token=None:string):
session = boto3.session.Session()
glue_client = session.client('glue')
try:
paginator = glue_client.get_paginator('get_job_runs')
response = paginator.paginate(JobName=job_name, PaginationConfig={
'MaxItems': max_items,
'PageSize': page_size,
'StartingToken': starting_token}
)
return response
except ClientError as e:
raise Exception("boto3 client error in paginate_through_jobruns: " + e.__str__())
except Exception as e:
raise Exception("Unexpected error in paginate_through_jobruns: " + e.__str__())
a = paginate_through_crawlers("glue_test_job", 1, 5)
print(*a)
실행 결과
{'JobRuns': [
{'Id': 'jr_435b66cfe451adf5fa7c7f914be3c87d199616f52bd13bdd91bb1269f02db705', 'Attempt': 0, 'JobName': ' glue_test_job, 'StartedOn': datetime.datetime(2021, 1, 25, 22, 19, 56, 52000, tzinfo=tzlocal()), 'LastModifiedOn': datetime.datetime(2021, 1, 25, 22, 21, 50, 603000, tzinfo=tzlocal()), 'CompletedOn': datetime.datetime(2021, 1, 25, 22, 21, 50, 603000, tzinfo=tzlocal()), 'JobRunState': 'SUCCEEDED', 'Arguments': {'--additional-python-modules': 'pandas==1.1.5', '--enable-glue-datacatalog': 'true', '--extra-files': 's3://glue/job/test, '--job-bookmark-option': 'job-bookmark-disable', 'step': '0'}, 'PredecessorRuns': [], 'AllocatedCapacity': 2, 'ExecutionTime': 107, 'Timeout': 2880, 'MaxCapacity': 2.0, 'WorkerType': 'G.1X', 'NumberOfWorkers': 2, 'LogGroupName': '/aws-glue/jobs', 'GlueVersion': '2.0'}],
'NextToken': 'eyJleHBpcmF0aW9uIjp7InNlY29uZHMiOjE2MTc0NTQ0NDgsIm5hbm9zIjo2OTUwMDAwMDB9LCJsYXN0RXZhbHVhdGVkS2V5Ijp7ImpvYklkIjp7InMiOiJqXzdlYzIzNTYwOWRkMGVmYjRhNTgyNDU2YWVlZmQ4NmFlMTgwYTAyNDQ3NWY2ODRkMzc4YWFiZDBmYTk1MGJmMDcifSwicnVuSWQiOnsicyI6ImpyXzJjNDFkMmJmMzY1NGZhZGFhYzkzMjU1ZTY0OTkxOTg2YTE0Yjk2MjIyMTRlNDc4ZGNkOWE0ZTY5N2M3MGZmY2YifSwic3RhcnRlZE9uIjp7Im4iOiIxNjExMjA3MjcwODIyIn19fQ==',
'ResponseMetadata': {'RequestId': '1874370e-***********-40d', 'HTTPStatusCode': 200, 'HTTPHeaders': {'date': 'Fri, 02 Apr 2021 12:54:08 GMT', 'content-type': 'application/x-amz-json-1.1', 'content-length': '6509', 'connection': 'keep-alive', 'x-amzn-requestid': '1874370e-**************40d'}, 'RetryAttempts': 0}}핵심 요약
boto3의 paginator 기능을 활용하면 대량의 AWS Glue 작업 실행 이력도 효율적으로 조회할 수 있습니다. 특히 MaxItems와 PageSize를 조절해 원하는 만큼씩 데이터를 가져오고, 응답에 포함된 NextToken을 다음 호출의 StartingToken으로 전달하면 전체 데이터를 순차적으로 탐색할 수 있습니다. 또한 ClientError와 일반 예외를 분리 처리하면 오류 원인을 더 명확하게 진단할 수 있습니다.