파이썬의 Scikit-learn(Sklearn) 라이브러리는 다양한 그래프와 플롯을 만들어 볼 수 있는 샘플 데이터셋을 기본적으로 제공합니다. 이러한 데이터셋은 실제 데이터를 사용하기 전에 샘플 그래프와 차트를 만들고, 값이 변할 때 그래프가 어떻게 동작하는지 예측해 보는 데 매우 유용합니다. 또한 실제 데이터에 적용하기 전에 색상, 축 설정 등 그래프의 여러 요소들을 미리 실험해 볼 수 있다는 장점도 있습니다.
make_blobs를 사용한 클러스터 데이터 생성
아래 예제에서는 sklearn 라이브러리와 matplotlib를 함께 사용하여 특정 스타일의 산점도(scatter plot)를 생성합니다. 200개의 데이터 포인트를 샘플로 선택하고, 클러스터의 개수와 표준편차, 그리고 점의 색상과 크기를 직접 지정했습니다.
예제 코드
from sklearn.datasets import make_blobs
from matplotlib import pyplot as plt
from matplotlib import style
style.use("fast")
X, y = make_blobs(n_samples=200, centers=4,
cluster_std=1, n_features=2)
plt.scatter(X[:, 0], X[:, 1], s=60, color='r')
plt.xlabel("X")
plt.ylabel("Y")
plt.show()
plt.clf()실행 결과
위 코드를 실행하면 다음과 같은 결과를 얻을 수 있습니다.

make_circles를 사용한 원형 데이터 생성
앞선 방법과 유사하게, 이번에는 make_circles 함수를 사용하여 100개의 샘플로 구성된 원형 데이터를 만들고 파란색으로 시각화합니다. noise 파라미터를 조절하면 데이터가 원형에서 얼마나 벗어나는지(잡음의 정도)를 설정할 수 있습니다.
예제 코드
from sklearn.datasets import make_circles
from matplotlib import pyplot as plt
from matplotlib import style
style.use("fast")
X, y = make_circles(n_samples=100, noise=0.04)
plt.scatter(X[:, 0], X[:, 1], s=40, color='b')
plt.xlabel("X")
plt.ylabel("Y")
plt.show()
plt.clf()실행 결과
위 코드를 실행하면 다음과 같은 결과를 얻을 수 있습니다.
