Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

TensorFlow로 전복 데이터셋 CSV 파일 불러오는 방법 완벽 가이드

전복(Abalone) 데이터셋은 이 데이터를 저장하고 있는 Google API를 통해 다운로드할 수 있습니다. Pandas 라이브러리에서 제공하는 read_csv 메서드를 사용하면 API에 있는 데이터를 CSV 형태로 손쉽게 읽어올 수 있으며, 이때 각 특성(feature)의 이름도 명시적으로 지정해 주는 것이 좋습니다.

전복 데이터셋이란?

이 튜토리얼에서 사용할 전복 데이터셋은 전복이라는 해산 물고기(바다 달팽이의 일종)의 다양한 신체 측정값들을 담고 있습니다. 데이터셋에는 길이, 지름, 높이, 무게 관련 여러 특성들이 포함되어 있으며, 목표는 이러한 측정값들을 바탕으로 전복의 나이를 예측하는 것입니다.

개발 환경: Google Colaboratory

아래 코드는 Google Colaboratory(줄여서 Colab) 환경에서 실행됩니다. Google Colab은 브라우저에서 바로 Python 코드를 실행할 수 있게 해주는 도구로, 별도의 설정 없이 무료로 GPU(그래픽 처리 장치)까지 사용할 수 있다는 장점이 있습니다. Colaboratory는 Jupyter Notebook을 기반으로 만들어졌습니다.

CSV 데이터 로드 코드

import pandas as pd
import numpy as np

print("아래 설정을 통해 NumPy 값을 더 읽기 쉽게 출력할 수 있습니다")
np.set_printoptions(precision=3, suppress=True)

import tensorflow as tf
from tensorflow.keras import layers
from tensorflow.keras.layers.experimental import preprocessing

print("CSV 데이터를 읽어오는 중입니다")
abalone_train = pd.read_csv("https://storage.googleapis.com/download.tensorflow.org/data/abalone_train.csv",
    names=["Length", "Diameter", "Height", "Whole weight", "Shucked weight","Viscera weight", "Shell weight", "Age"])

코드 출처: https://www.tensorflow.org/tutorials/load_data/csv

실행 결과

아래 설정을 통해 NumPy 값을 더 읽기 쉽게 출력할 수 있습니다
CSV 데이터를 읽어오는 중입니다

코드 설명

  • 필요한 패키지들(Pandas, NumPy, TensorFlow 등)을 환경에 임포트합니다.
  • Pandas의 read_csv 메서드를 사용해 URL로부터 CSV 데이터를 읽어옵니다.
  • names 매개변수를 통해 길이(Length), 지름(Diameter), 높이(Height), 전체 무게(Whole weight), 껍질 제거 무게(Shucked weight), 내장 무게(Viscera weight), 껍질 무게(Shell weight), 나이(Age) 등 각 열의 이름을 명확하게 지정합니다.
  • 데이터셋의 모든 특성들은 동일한 방식으로 처리되어야 하며, 이후 이 특성들을 하나의 NumPy 배열로 묶어 모델 학습에 사용하게 됩니다.