Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

TensorFlow로 데이터셋 탐색하기: Python으로 Stack Overflow 질문 데이터셋 샘플 파일 살펴보기

TensorFlow는 구글(Google)에서 제공하는 머신러닝 프레임워크입니다. 오픈소스 기반 프레임워크로, Python과 함께 사용하여 알고리즘 구현, 딥러닝 애플리케이션 개발 등 다양한 작업을 수행할 수 있으며, 연구 목적과 실제 프로덕션 환경 모두에서 활용됩니다.

Windows 환경에서는 아래 명령어 한 줄로 'tensorflow' 패키지를 설치할 수 있습니다.

pip install tensorflow

Keras는 ONEIROS(Open-ended Neuro-Electronic Intelligent Robot Operating System) 프로젝트의 연구 과정에서 개발된 딥러닝 API로, Python으로 작성되었습니다. 높은 수준의 추상화를 제공하는 고수준(high-level) API로서, 생산적인 인터페이스를 통해 머신러닝 문제를 효율적으로 해결할 수 있도록 돕습니다. Keras는 TensorFlow 프레임워크 위에서 동작하며, 빠른 실험과 반복을 지원하기 위해 설계되었습니다. 또한 머신러닝 솔루션을 개발하고 캡슐화하는 데 필수적인 추상화 계층과 빌딩 블록을 제공합니다.

Keras는 이미 TensorFlow 패키지에 포함되어 있으며, 아래 코드 한 줄로 간단히 불러올 수 있습니다.

import tensorflow
from tensorflow import keras

이 글의 예제 코드는 Google Colaboratory(Colab)에서 실행됩니다. Google Colab은 브라우저에서 바로 Python 코드를 실행할 수 있는 환경으로, 별도의 설정이 필요 없으며 GPU(그래픽 처리 장치)를 무료로 사용할 수 있다는 장점이 있습니다. Colaboratory는 Jupyter Notebook을 기반으로 구축되었습니다.

아래는 데이터셋을 탐색하고 샘플 파일을 확인하는 코드입니다.

예제 코드

print("디렉터리 내 파일 목록을 출력합니다")
list(dataset_dir.iterdir())
print("Stack Overflow 질문 데이터는 'train/' 디렉터리에 저장되어 있습니다")
train_dir = dataset_dir/'train'
list(train_dir.iterdir())
sample_file = train_dir/'python/1755.txt'
print("샘플 파일의 내용을 출력합니다")
with open(sample_file) as f:
    print(f.read())

코드 출처: https://www.tensorflow.org/tutorials/load_data/text

실행 결과

디렉터리 내 파일 목록을 출력합니다
Stack Overflow 질문 데이터는 'train/' 디렉터리에 저장되어 있습니다
샘플 파일의 내용을 출력합니다
why does this blank program print true x=true.def stupid():. x=false.stupid().print x

코드 설명

  • iterdir() 메서드를 사용해 데이터셋 디렉터리 내부의 파일 및 하위 폴더 목록을 확인합니다.

  • Stack Overflow 질문 데이터가 train/ 디렉터리에 언어별(예: python)로 분류되어 저장되어 있음을 확인합니다.

  • open() 함수를 통해 특정 샘플 텍스트 파일(python/1755.txt)을 열고, 해당 질문 데이터의 실제 내용을 콘솔에 출력합니다.

  • 이 과정을 통해 텍스트 분류 모델 학습 전에 데이터셋의 구조와 형식을 파악할 수 있습니다.