Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

데이터 마이닝 메트릭이란? 핵심 평가 지표 완벽 정리

데이터 마이닝은 인공지능(AI)의 한 형태로, 지각 모델과 분석 모델, 그리고 다양한 알고리즘을 활용하여 인간 두뇌의 사고 과정을 모방합니다. 이를 통해 기계가 사람처럼 판단하고 선택을 내릴 수 있도록 지원합니다.

다만 데이터 마이닝 도구가 제대로 작동하려면 사용자가 머신에 규칙, 선호도, 심지어 경험까지 직접 지정해 주어야 합니다. 그렇다면 데이터 마이닝 모델의 성능을 평가하는 메트릭(측정 지표)에는 어떤 것들이 있을까요? 대표적인 데이터 마이닝 메트릭을 하나씩 살펴보겠습니다.

1. 유용성(Usefulness)

유용성은 해당 모델이 실제로 쓸모 있는 데이터를 제공하는지를 판단하는 여러 지표를 포함합니다. 예를 들어, 매장 위치와 매출 간의 상관관계를 분석하는 데이터 마이닝 모델이 정확하고 신뢰할 수 있더라도, 같은 위치에 더 많은 매장을 열었을 때 그 결과를 일반화할 수 없다면 유용하지 않다고 볼 수 있습니다.

또한 이러한 모델은 "왜 특정 위치에서 매출이 더 높은가?"라는 근본적인 비즈니스 질문에 답하지 못합니다. 겉보기에 성공적으로 보이는 모델이라도 데이터 속 교차 상관관계(cross-correlation)에 의존한다면 무의미할 수 있다는 점도 유의해야 합니다.

2. 투자 수익률(ROI)

데이터 마이닝 도구는 데이터 속에 숨겨진 흥미로운 패턴을 발견하고 예측 모델을 만들어냅니다. 이러한 모델에는 데이터 적합도를 나타내는 여러 측정값이 존재하지만, 데이터 마이닝 분석 결과로 보고된 일부 지표만으로 어떻게 의사결정을 내려야 할지는 명확하지 않습니다.

따라서 모델의 성능을 단순히 통계적 지표로만 평가하기보다는, 실제 비즈니스 관점에서 얼마나 많은 가치와 수익을 창출하는지를 함께 고려해야 합니다.

3. 데이터 마이닝 중 재무 정보 활용

의사결정을 재무적 관점에서 평가하는 가장 간단한 방법은, 일반적으로 마이닝되는 원시 데이터에 재무 데이터를 추가로 포함시키는 것입니다. 실제로 일부 조직은 데이터 웨어하우스(data warehouse)와 데이터 마트(data mart) 구축에 투자하고 있습니다.

웨어하우스나 마트를 설계할 때는 예상되는 쿼리에 필요한 분석 유형과 데이터 종류를 고려해야 합니다. 제품 속성, 사용자 프로필 등 일반적인 데이터뿐 아니라 재무 정보에도 함께 접근할 수 있도록 설계하면 큰 도움이 됩니다.

4. 데이터 마이닝 메트릭을 재무 용어로 변환

대표적인 데이터 마이닝 메트릭 중 하나가 바로 '리프트(Lift)'입니다. 리프트는 모델을 사용하지 않았을 때의 기본 비율(base rate)과 비교하여, 특정 모델이나 패턴을 적용함으로써 얻는 성과를 측정한 값입니다. 값이 높을수록 더 많은 성과를 거두었다는 의미입니다.

그렇다면 리프트 값만 보고 곧바로 의사결정을 내릴 수 있을까요? 실제로는 리프트를 금전적 가치로 환산하여 평가하는 것이 훨씬 바람직합니다.

5. 정확도(Accuracy)

정확도는 모델이 학습된 데이터의 속성과 결과를 얼마나 잘 연관 짓는지를 측정하는 지표입니다. 정확도에는 여러 측정 방식이 있지만, 모든 정확도 측정은 사용된 데이터에 의존합니다. 현실에서는 값이 누락되거나 근사치일 수 있으며, 여러 처리 과정에서 데이터가 변경되었을 가능성도 있습니다.

탐색 및 개발 과정에서는 특히 데이터의 특성이 비교적 균일하다면 어느 정도의 오류를 허용하기로 결정할 수 있습니다. 예를 들어, 과거 매출을 기반으로 특정 매장의 매출을 예측하는 모델은 해당 매장이 지속적으로 잘못된 회계 기법을 사용했더라도 강력하게 상관관계를 보이며 매우 정확할 수 있습니다. 따라서 정확도 측정은 반드시 신뢰성(reliability) 평가와 균형을 이루어야 합니다.

마무리

데이터 마이닝 메트릭은 모델의 성능을 다각도로 평가할 수 있게 해주는 필수 도구입니다. 유용성, ROI, 리프트, 정확도 등 각 지표의 장단점을 이해하고 서로 보완적으로 활용할 때, 데이터 기반 의사결정의 신뢰성과 비즈니스 가치를 동시에 높일 수 있습니다.