지금까지 빅 데이터에 관한 블로그 시리즈를 통해 빅 데이터의 실제 의미부터 핵심 팩트, 그리고 유의사항에 이르기까지 다양한 측면을 살펴보았습니다. 지난 글에서는 일부 빅 데이터 분석 기법을 소개했는데요, 이번 2부에서는 나머지 기법들을 이어서 자세히 알아보겠습니다.
14. 패턴 인식(Pattern Recognition)
패턴 인식은 데이터 속에서 패턴과 규칙성을 찾아내는 데 초점을 맞춘 머신러닝의 한 분야입니다. 경우에 따라서는 머신러닝과 거의 동의어로 여겨지기도 합니다. 패턴 인식 시스템은 대개 라벨이 붙어 있는 '훈련(training)' 데이터로 학습되는 지도 학습(supervised learning) 방식을 사용하지만, 라벨이 없는 데이터만 있을 경우에는 다른 알고리즘을 활용해 미처 알려지지 않은 패턴을 발견하는 비지도 학습(unsupervised learning) 방식으로도 구현할 수 있습니다.

15. 예측 모델링(Predictive Modelling)
예측 분석은 과거와 현재의 데이터를 바탕으로 미래 결과를 예측하는 다양한 기법을 포괄합니다. 실무에서 예측 분석은 거의 모든 분야에 적용될 수 있습니다. 수천 개 센서에서 들어오는 데이터 스트림을 기반으로 제트 엔진의 고장을 예측하는 것부터, 고객이 무엇을 언제 구매하는지, 심지어 소셜 미디어에 어떤 이야기를 하는지까지 분석해 고객의 다음 행동을 예측하는 것까지 그 범위가 매우 넓습니다. 예측 분석 기법은 주로 통계적 방법론에 기반하고 있습니다.
16. 회귀 분석(Regression Analysis)
회귀 분석은 독립 변수가 종속 변수에 어떤 영향을 미치는지 파악하는 기법입니다. 온라인 플랫폼에서 사랑에 성공할 확률을 추정하는 것과 같은 소셜 미디어 분석을 수행할 때 매우 유용하게 활용할 수 있습니다.
17. 감성 분석(Sentiment Analysis)
감성 분석은 특정 주제에 대해 화자나 작성자가 어떤 감정과 태도를 보이는지 파악하도록 돕는 기술입니다. 현재 감성 분석은 다음과 같은 용도로 활용되고 있습니다.
- 투숙객 후기를 분석하여 호텔 체인의 서비스 품질 개선
- 고객이 실제로 원하는 것이 무엇인지 파악해 맞춤형 인센티브와 서비스 제공
- 소셜 미디어상의 의견을 바탕으로 소비자의 진짜 생각 도출
18. 신호 처리(Signal Processing)
신호 처리는 물리적·기호적·추상적인 다양한 형식으로 표현되는 정보, 즉 넓은 의미의 신호(signal)를 처리하거나 전송하기 위한 기본 이론, 응용, 알고리즘, 구현 방법을 아우르는 핵심 기반 기술입니다. 신호의 표현, 모델링, 분석, 합성, 발견, 복원, 감지, 획득, 추출, 학습, 보안, 포렌식 등을 위해 수학적, 통계적, 계산적, 휴리스틱, 언어학적 표현과 기법을 활용합니다. 대표적인 응용 사례로는 시계열 분석을 위한 모델링이나, 정밀도가 낮은 여러 데이터 소스의 데이터를 결합해 더 정확한 값을 도출하는 데이터 융합(data fusion), 즉 '노이즈 속에서 신호를 추출'하는 작업이 있습니다.
19. 공간 분석(Spatial Analysis)
공간 분석은 원시 데이터를 유용한 정보로 전환하는 과정입니다. 공간 데이터에 담긴 위치, 속성, 그리고 요소 간의 관계를 오버레이(overlay) 등 다양한 분석 기법을 통해 조심스럽게 검토함으로써 특정 질문에 답하거나 유용한 지식을 얻는 작업입니다. 공간 분석은 공간 데이터로부터 새로운 정보를 추출하거나 창조해냅니다.
20. 통계 분석(Statistics)
통계학에서 탐색적 데이터 분석(EDA, Exploratory Data Analysis)은 데이터 세트의 주요 특성을 요약하기 위해 수행하는 접근 방식으로, 주로 시각화 기법을 활용합니다. 통계 모델을 사용할 수도 있고 사용하지 않을 수도 있지만, EDA의 본질은 정형화된 모델링이나 가설 검정 이전 단계에서 '데이터가 우리에게 무엇을 말해주는지'를 먼저 확인하는 데 있습니다. 또한 통계 기법은 1종 오류('거짓 양성')와 2종 오류('거짓 음성')의 발생 가능성을 줄이는 데에도 활용됩니다. 대표적인 응용 사례로는 어떤 마케팅 소재가 매출 증대에 가장 효과적인지 판단하기 위한 A/B 테스트가 있습니다.
21. 지도 학습(Supervised Learning)
지도 학습은 라벨이 붙은 훈련 데이터로부터 함수를 추론하는 머신러닝 작업입니다. 훈련 데이터는 훈련 예시(training examples)들의 집합으로 구성되며, 지도 학습에서 각 예시는 입력 객체(일반적으로 벡터)와 원하는 출력 값(지도 신호(supervisory signal)이라고도 함)으로 이루어진 쌍(pair)입니다. 지도 학습 알고리즘은 훈련 데이터를 분석하여 추론된 함수를 생성하고, 이 함수는 새로운 예시를 매핑하는 데 활용됩니다.

22. 사회 연결망 분석(Social Network Analysis)
사회 연결망 분석은 처음에는 통신 산업에서 사용되다가, 이후 사회학자들이 인간관계를 연구하기 위해 빠르게 도입한 기법입니다. 현재는 다양한 분야와 상업 활동에서 사람들 사이의 관계를 분석하는 데 폭넓게 적용되고 있습니다. 네트워크에서 노드(node)는 개인을 나타내고, 연결(tie)은 개인 간의 관계를 나타냅니다.
23. 시뮬레이션(Simulation)
시뮬레이션은 복잡한 시스템의 행동을 모델링하는 기법으로, 주로 예측, 전망, 시나리오 기획에 활용됩니다. 예를 들어 몬테카를로 시뮬레이션(Monte Carlo simulation)은 반복적인 무작위 샘플링에 의존하는 알고리즘으로, 서로 다른 가정을 기반으로 수천 번의 시뮬레이션을 실행합니다. 그 결과로 각 결과값의 확률 분포를 보여주는 히스토그램을 얻을 수 있습니다. 한 가지 응용 사례는 다양한 사업 추진의 성공 여부가 불확실한 상황에서 재무 목표 달성 가능성을 평가하는 것입니다.
24. 시계열 분석(Time Series Analysis)
시계열 분석은 시계열 데이터를 분석하여 의미 있는 통계치와 데이터의 다른 특성을 추출하는 방법론입니다. 시계열 데이터는 산업 공정을 모니터링하거나 기업의 비즈니스 지표를 추적할 때 자주 발생합니다. 시계열 분석은 시간에 걸쳐 수집된 데이터 포인트들이 자기상관(autocorrelation), 추세(trend), 계절 변동(seasonal variation)과 같은 내부 구조를 가질 수 있다는 점을 고려합니다. 시계열 분석의 예로는 주가 지수의 시간당 값이나, 매일 특정 질환으로 진단받는 환자 수의 추이 등이 있습니다.
25. 비지도 학습(Unsupervised Learning)
비지도 학습은 라벨이 없는 데이터로부터 숨겨진 구조를 설명하는 함수를 추론하는 머신러닝 작업입니다. 학습자에게 주어진 예시에 라벨이 없기 때문에 잠재적 해답을 평가할 오류 신호나 보상 신호가 존재하지 않으며, 이것이 비지도 학습을 지도 학습 및 강화 학습과 구분 짓는 핵심 차이점입니다.

그러나 비지도 학습은 데이터의 핵심 특징을 요약하고 설명하려는 다양한 다른 기법들도 포괄합니다.
26. 시각화(Visualization)
데이터 시각화는 데이터를 그림이나 그래프 형태로 표현하는 작업입니다. 의사결정권자가 분석 결과를 시각적으로 확인할 수 있게 함으로써 어려운 개념을 쉽게 이해하거나 새로운 패턴을 발견하도록 돕습니다. 인터랙티브 시각화를 활용하면 한 단계 더 나아가 기술을 통해 차트와 그래프를 깊이 있게 탐색하고, 어떤 데이터를 볼지 그리고 어떻게 처리할지를 대화형으로 변경할 수 있습니다.
결론

빅 데이터 분석은 정보기술(IT) 산업에서 가장 중요한 돌파구 중 하나였습니다. 실제로 빅 데이터는 거의 모든 산업 분야와 그 산업 내 거의 모든 부서에서 그 필요성과 중요성을 입증해 왔습니다. 빅 데이터의 영향을 받지 않는 삶의 영역은 없으며, 우리 개인의 삶조차 예외가 아닙니다. 따라서 우리는 이 방대한 양의 데이터를 효율적으로 관리하기 위해 빅 데이터 분석이 반드시 필요합니다.
앞서 말씀드린 것처럼 이 목록이 빅 데이터 분석 기법의 전부는 아닙니다. 연구자들은 시간이 지날수록 생성 속도가 빨라지고 다양한 형태로 존재하는 방대한 데이터에서 우리에게 필요한 가치를 도출하기 위해 새로운 분석 방법을 끊임없이 실험하고 있습니다.