Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

Boto3로 AWS Glue 테이블 버전 페이지네이션하는 방법 완벽 가이드

문제 상황: Python의 boto3 라이브러리를 사용하여 본인 계정에서 생성한 AWS Glue Data Catalog의 특정 테이블 버전 목록을 페이지네이션(페이지 매김) 방식으로 조회하고자 합니다.

문제 해결 접근 방식 및 알고리즘

  • 1단계: 예외 처리를 위해 boto3botocore의 예외 클래스를 임포트합니다.

  • 2단계: 함수의 필수 파라미터는 database_nametable_name이며, 선택적 파라미터는 max_items, page_size, starting_token입니다.

    • max_items: 반환할 레코드의 총 개수를 의미합니다. 사용 가능한 레코드 수가 max_items보다 많으면 응답에 NextToken이 포함되어 이후 페이지네이션을 이어갈 수 있습니다.

    • page_size: 한 페이지당 포함될 레코드의 크기를 나타냅니다.

    • starting_token: 페이지네이션을 재개할 때 사용하며, 이전 응답에서 받은 NextToken 값을 전달합니다.

  • 3단계: boto3 라이브러리를 사용해 AWS 세션을 생성합니다. 기본 프로필에 region_name이 설정되어 있지 않다면, 세션 생성 시 명시적으로 리전 이름을 전달해야 합니다.

  • 4단계: Glue 서비스를 위한 AWS 클라이언트를 생성합니다.

  • 5단계: get_table_versions를 사용하여 특정 테이블의 모든 버전 정보를 담은 paginator(페이지네이터) 객체를 생성합니다.

  • 6단계: paginate 함수를 호출하면서 DatabaseName에는 database_name을, TableName에는 table_name을 전달하고, max_items, page_size, starting_tokenPaginationConfig 파라미터로 설정합니다.

  • 7단계: 설정된 max_itemspage_size 값에 따라 해당 개수만큼의 레코드가 반환됩니다.

  • 8단계: 페이지네이션 과정에서 오류가 발생할 경우 일반 예외(generic exception)를 처리합니다.

예제 코드

사용자 계정에 생성된 테이블의 버전 목록을 페이지네이션으로 조회하려면 아래 코드를 활용하세요.

import boto3
from botocore.exceptions import ClientError

def paginate_through_table_versions(database_name, table_name,
                                    max_items=None, page_size=None,
                                    starting_token=None):
    session = boto3.session.Session()
    glue_client = session.client('glue')
    try:
        paginator = glue_client.get_paginator('get_table_versions')
        response = paginator.paginate(
            DatabaseName=database_name,
            TableName=table_name,
            PaginationConfig={
                'MaxItems': max_items,
                'PageSize': page_size,
                'StartingToken': starting_token
            }
        )
        return response
    except ClientError as e:
        raise Exception(
            "boto3 client error in paginate_through_table_versions: " + e.__str__())
    except Exception as e:
        raise Exception(
            "Unexpected error in paginate_through_table_versions: " + e.__str__())

a = paginate_through_table_versions("test_db", "qa_table", 2, 5)
print(*a)

실행 결과

위 코드를 실행하면 다음과 같이 테이블 버전 정보가 딕셔너리 형태로 출력됩니다. 각 버전에는 테이블 이름, 데이터베이스 이름, 소유자, 생성/수정 시간, 스키마 컬럼 정보, S3 위치, 직렬화 라이브러리 등이 포함됩니다.

{'TableVersions': [
{'Table': {'Name': 'qa_table', 'DatabaseName': 'test_db', 'Owner': 'owner',
'CreateTime': datetime.datetime(2018, 9, 24, 20, 43, 3, tzinfo=tzlocal()),
'UpdateTime': datetime.datetime(2018, 9, 24, 20, 43, 3, tzinfo=tzlocal()),
'LastAccessTime': datetime.datetime(2018, 9, 24, 20, 43, 3, tzinfo=tzlocal()),
'Retention': 0, 'StorageDescriptor':
{'Columns': [{'Name': 'accounnumber', 'Type': 'int'},
{'Name': 'country', 'Type': 'string'}, {'Name': 'currency', 'Type': 'string'},
{'Name': 'date', 'Type': 'bigint'}, {'Name': 'securitynumber', 'Type': 'string'},
{'Name': 'crossxreferencexcode', 'Type': 'string'},
{'Name': 'securityxdescriptionxxlongx1x', 'Type': 'string'}],
'Location': 's3://qa/success/',
'InputFormat': 'org.apache.hadoop.hive.ql.io.avro.AvroContainerInputFormat',
'OutputFormat': 'org.apache.hadoop.hive.ql.io.avro.AvroContainerOutputFormat',
'Compressed': False, 'NumberOfBuckets': -1,
'SerdeInfo': {'SerializationLibrary': ...}, 'VersionId': '0'}}],
'ResponseMetadata': {'RequestId': '931c99f8-c473-4421-9f0f-1ca33b313e67',
'HTTPStatusCode': 200, 'HTTPHeaders': {
'date': 'Fri, 02 Apr 2021 13:29:04 GMT',
'content-type': 'application/x-amz-json-1.1', 'content-length': '16718',
'connection': 'keep-alive',
'x-amzn-requestid': '931c99f8-c473-4421-9f0f-1ca33b313e67'},
'RetryAttempts': 0}}

핵심 요약

AWS Glue Data Catalog의 테이블 버전이 많은 경우, boto3의 paginator 기능을 활용하면 대량의 데이터를 효율적으로 나눠 조회할 수 있습니다. MaxItems로 전체 조회량을 제한하고, PageSize로 페이지 크기를 조절하며, 응답에 포함된 NextTokenStartingToken으로 전달하면 중단된 지점부터 이어서 조회할 수 있습니다. 또한 ClientError와 일반 예외를 분리 처리하면 오류 원인을 더 명확하게 진단할 수 있습니다.