문제 상황: Python의 boto3 라이브러리를 사용하여 본인 계정의 AWS Glue Data Catalog에 생성된 모든 테이블을 페이지네이션(페이지 매김) 방식으로 조회하는 방법을 알아봅니다. 대량의 테이블이 등록된 카탈로그에서 한 번에 모든 결과를 가져오는 대신, 원하는 크기로 나누어 효율적으로 조회할 때 유용한 기법입니다.
문제 해결 접근 방식 및 알고리즘
1단계: 예외 처리를 위해 boto3와 botocore의 예외 클래스를 임포트합니다.
2단계: 함수 매개변수를 이해합니다. database_name은 필수 값이며, max_items, page_size, starting_token은 선택적 매개변수입니다.
max_items: 반환할 레코드의 총 개수를 의미합니다. 사용 가능한 레코드 수가 max_items보다 많으면 응답에 NextToken이 포함되어 이후 페이지네이션을 이어갈 수 있습니다.
page_size: 한 페이지에 포함될 레코드 수를 나타냅니다.
starting_token: 페이지네이션을 재개할 때 사용하며, 이전 응답에서 받은 NextToken 값을 전달합니다.
3단계: boto3 라이브러리로 AWS 세션을 생성합니다. 기본 프로필에 region_name이 설정되어 있지 않다면, 세션 생성 시 리전 이름을 명시적으로 전달해야 합니다.
4단계: Glue 서비스용 AWS 클라이언트를 생성합니다.
5단계: get_tables API를 기반으로 모든 테이블 정보를 담는 paginator 객체를 생성합니다.
6단계: paginate 함수를 호출하고, database_name을 DatabaseName으로 전달하며, max_items, page_size, starting_token을 PaginationConfig로 설정합니다.
7단계: max_items와 page_size 설정에 따라 지정된 개수만큼의 레코드가 반환됩니다.
8단계: 페이지네이션 과정에서 오류가 발생하면 일반 예외를 처리하여 적절한 에러 메시지를 출력합니다.
예제 코드
아래 코드를 사용하면 계정에 생성된 모든 테이블을 페이지 단위로 조회할 수 있습니다.
import boto3
from botocore.exceptions import ClientError
def paginate_through_tables(database_name, max_items=None, page_size=None, starting_token=None):
session = boto3.session.Session()
glue_client = session.client('glue')
try:
paginator = glue_client.get_paginator('get_tables')
response = paginator.paginate(
DatabaseName=database_name,
PaginationConfig={
'MaxItems': max_items,
'PageSize': page_size,
'StartingToken': starting_token
}
)
return response
except ClientError as e:
raise Exception("boto3 client error in paginate_through_tables: " + str(e))
except Exception as e:
raise Exception("Unexpected error in paginate_through_tables: " + str(e))
a = paginate_through_tables("test_db", 2, 5)
print(*a)
출력 결과
위 코드를 실행하면 test_db 데이터베이스의 테이블 메타데이터가 페이지 단위로 반환됩니다. 각 테이블 항목에는 테이블 이름, 소유자, 생성 시간, 컬럼 스키마, S3 위치, 입력/출력 포맷, 직렬화 정보(SerDe), 파티션 키, 테이블 유형 등이 포함됩니다.
{'TableList': [
{'Name': 'temp_table', 'DatabaseName': 'test_db', 'Owner': 'abc',
'CreateTime': datetime.datetime(2020, 9, 10, 20, 44, 29, tzinfo=tzlocal()),
'UpdateTime': datetime.datetime(2020, 9, 10, 20, 44, 29, tzinfo=tzlocal()),
'Retention': 0,
'StorageDescriptor': {
'Columns': [
{'Name': 'keyname', 'Type': 'string'},
{'Name': 'amount', 'Type': 'string'},
{'Name': 'effectivedate', 'Type': 'string'},
{'Name': 'clientname', 'Type': 'string'},
{'Name': 'accoutname', 'Type': 'varchar(5)'},
{'Name': 'clientid', 'Type': 'varchar(6)'}],
'Location': 's3://test/',
'InputFormat': 'org.apache.hadoop.hive.ql.io.parquet.MapredParquetInputFormat',
'OutputFormat': 'org.apache.hadoop.hive.ql.io.parquet.MapredParquetOutputFormat',
'Compressed': False,
'SerdeInfo': {'SerializationLibrary': 'org.apache.hadoop.hive.ql.io.parquet.serde.ParquetHiveSerDe'}},
'TableType': 'EXTERNAL_TABLE',
'Parameters': {'EXTERNAL': 'TRUE', 'parquet.compression': 'SNAPPY'}},
{'Name': 'test_3', 'DatabaseName': 'test_db', 'Owner': 'abc',
'CreateTime': datetime.datetime(2020, 9, 10, 21, 54, 39, tzinfo=tzlocal()),
'StorageDescriptor': {'Location': 's3://test3/', ...},
'TableType': 'EXTERNAL_TABLE'}],
'ResponseMetadata': {'RequestId': 'dd35e6c5-...', 'HTTPStatusCode': 200,
'HTTPHeaders': {'date': 'Fri, 02 Apr 2021 13:42:48 GMT',
'content-type': 'application/x-amz-json-1.1'},
'RetryAttempts': 0}}
이처럼 PaginationConfig를 활용하면 Glue Data Catalog의 테이블 목록을 max_items와 page_size 조건에 맞게 나누어 조회할 수 있으며, 결과가 잘릴 경우 반환되는 NextToken을 starting_token으로 전달해 다음 페이지를 이어서 조회할 수 있습니다.