회귀(Regression)란?
회귀는 연속적인 값을 지닌 속성을 예측하는 데 활용되는 지도 학습(supervised learning) 기반 머신러닝 기법입니다. 회귀 분석을 통해 기업과 조직은 목표 변수(target variable)와 예측 변수(predictor variable) 사이의 관계를 탐색할 수 있으며, 재무 예측이나 시계열 모델링에도 널리 사용되는 필수적인 데이터 분석 도구입니다.
데이터는 회귀처럼 함수에 데이터를 맞추는 방식으로 평활화(smoothing)할 수 있습니다. 선형 회귀(linear regression)는 두 개의 속성(또는 변수)에 가장 적합한 '최적'의 직선을 찾아내어, 하나의 속성 값을 통해 다른 속성 값을 예측하는 기법입니다. 다중 선형 회귀(multiple linear regression)는 이를 확장한 형태로, 두 개 이상의 속성을 포함하며 데이터를 다차원 공간에 맞춥니다.
선형 회귀에서는 데이터가 하나의 직선에 맞도록 모델링됩니다. 예를 들어 확률 변수 y(반응 변수, response variable)를 다른 확률 변수 x(예측 변수, predictor variable)의 선형 함수로 나타낼 수 있으며, 그 식은 y = wx + b로 표현됩니다. 이때 y의 분산은 일정하다고 가정합니다.
회귀 문제는 입력값에 근거하여 출력값을 계산하는 작업을 다룹니다. 분류 목적으로 활용할 경우 입력값은 데이터베이스의 값이 되고, 출력값은 해당 클래스를 의미합니다. 회귀는 분류 문제를 탐색하는 데에도 쓰일 수 있지만, 예측(forecasting) 등 보다 폭넓은 응용 분야에 활용됩니다. 가장 기본적인 회귀 구조는 예측 변수 하나와 예측값 하나만으로 구성된 단순 선형 회귀(simple linear regression)입니다.
분류(Classification)란?
분류는 데이터의 클래스나 개념을 표현하고 구별해 주는 모델을 찾아내는 과정으로, 클래스 레이블이 알려지지 않은 객체의 클래스를 예측하기 위해 모델을 활용하는 것이 목적입니다. 도출된 모델은 학습 레코드 집합, 즉 클래스 레이블이 이미 알려져 있는 데이터 객체들을 분석한 결과를 바탕으로 만들어집니다.
각 튜플(tuple)은 미리 정의된 클래스에 속하는 것으로 간주되며, 이는 '클래스 레이블 속성(class label attribute)'이라 불리는 속성 중 하나에 의해 결정됩니다. 분류 구조에서 데이터 튜플은 샘플(sample), 예(example), 객체(object) 등으로 표현됩니다. 모델을 만들기 위해 분석된 데이터 튜플들이 모여 학습 데이터 세트(training data set)를 형성하며, 학습 세트를 구성하는 개별 튜플은 학습 샘플(training sample)이라 부르고 표본 모집단에서 선택됩니다.
모든 학습 샘플의 클래스 레이블이 제공되기 때문에 이러한 과정은 지도 학습(supervised learning)이라고 정의됩니다. 반면 비지도 학습(unsupervised learning)에서는 학습 샘플의 클래스 레이블이 알려지지 않아, 학습해야 할 클래스가 무엇인지 사전에 알 수 없습니다.
회귀와 분류의 핵심 차이
- 회귀: 주가, 온도, 매출액처럼 연속적인 실숫값을 예측합니다.
- 분류: 스팸 메일 여부, 질병 진단 결과처럼 미리 정의된 범주(클래스)를 예측합니다.
- 공통점: 두 기법 모두 학습 데이터를 기반으로 하는 지도 학습 방식에 속합니다.