Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

프로그래밍

  1. STREAM 알고리즘이란? 데이터 스트림 k-중심 클러스터링 완벽 이해

    STREAM 알고리즘이란? STREAM은 데이터 스트림 환경에서 k-중심(k-medians) 문제를 해결하기 위해 고안된 단일 패스(one-pass), 상수 인자 근사 알고리즘입니다. 스트림 데이터는 전체를 저장해 두고 반복해서 처리할 수 없기 때문에, 제한된 자원 안에서도 고품질의 군집화 결과를 얻을 수 있도록 설계된 것이 특징입니다. k-중심(k-medians) 문제의 정의 k-중심 문제는 N개의 데이터 포인트를 k개의 군집(cluster)으로 나누어, 각 포인트와 자신이 속한 군집의 중심 사이 제곱 오차 합(Sum of Sq

  2. CBR(사례 기반 추론)이란? 개념, 활용 분야, 작동 원리까지 완벽 정리

    CBR(사례 기반 추론)의 개념CBR은 Case-Based Reasoning(사례 기반 추론)의 약자로, 과거에 해결했던 유사한 문제의 사례를 활용하여 새로운 문제를 해결하는 인공지능 분류 기법입니다. CBR 분류기가 새로운 문제를 판별하기 위해서는 기존의 문제 해결 사례들을 담은 데이터베이스가 반드시 필요합니다.최근접 이웃(nearest-neighbor) 분류기가 훈련 튜플을 유클리드 공간상의 점으로 저장하는 것과 달리, CBR은 문제 해결에 사용되는 튜플, 즉 사례(case)를 복잡한 기호적 표현 형태로 저장한다는 점에서 차별화

  3. 일반화 선형 모델(GLM)이란 무엇일까? 개념과 주요 유형 완벽 정리

    일반화 선형 모델(GLM)이란?일반화 선형 모델(Generalized Linear Models, GLM)은 선형 회귀 분석을 범주형 반응 변수의 모델링으로 확장할 수 있도록 뒷받침하는 이론적 기반입니다. 선형 회귀에서는 반응 변수 y의 분산이 일정하게 유지되지만, 일반화 선형 모델에서는 y의 분산이 y의 평균값에 대한 함수로 표현된다는 점이 가장 큰 차이입니다.GLM은 전통적인 선형 모델의 확장 형태로, 로그 우도(log-likelihood)를 최대화하는 방식으로 데이터에 모델을 적합시킵니다. 또한 탄력적 네트(elastic net

  4. ROC 곡선이란 무엇일까? 개념부터 작성 방법과 해석까지

    ROC 곡선의 정의와 기원ROC는 Receiver Operating Characteristic(수신자 조작 특성)의 약자입니다. ROC 곡선은 두 개의 분류 모델을 비교하고 분석할 때 매우 유용한 시각적 도구로, 제2차 세계대전 중 레이더 이미지 탐색을 위해 발전된 신호 탐지 이론(signal detection theory)에서 그 기원을 찾을 수 있습니다.ROC 곡선이 보여주는 것ROC 곡선은 주어진 모델에 대해 진양성률(True Positive Rate, 민감도)과 위양성률(False Positive Rate) 사이의 트레이드오

  5. 간격 척도 변수 완벽 이해하기: 표준화부터 유클리드·맨해튼 거리까지

    간격 척도(interval-scaled) 변수는 대체로 선형적인 척도를 갖는 연속형 데이터를 말합니다. 몸무게와 키, 위도·경도 좌표(예: 주택 데이터를 군집화할 때), 기온 등이 대표적인 예입니다. 흥미로운 점은 사용하는 측정 단위가 군집 분석 결과에 직접적인 영향을 미친다는 것입니다.측정 단위가 군집 분석에 미치는 영향예를 들어 키의 단위를 미터에서 인치로, 몸무게의 단위를 킬로그램에서 파운드로 바꾸면 군집 구조 자체가 달라질 수 있습니다. 일반적으로 변수를 더 작은 단위로 정의할수록 해당 변수의 값 범위(range)가 넓어지고

  6. 이진 변수란 무엇인가? 개념부터 비유사성 계산까지 한눈에 보기

    이진 변수의 기본 개념이진 변수(binary variable)는 0 또는 1과 같이 단 두 가지 상태만 가지는 변수를 말합니다. 여기서 0은 해당 변수가 없음(absent)을 의미하고, 1은 있음(present)을 의미합니다.예를 들어 환자 정보를 나타내는 흡연 여부(smoker)라는 변수가 있다고 가정해 봅시다. 값이 1이면 해당 환자가 흡연자임을, 0이면 흡연하지 않음을 나타냅니다.주의할 점은, 이진 변수를 마치 구간 척도(interval-scaled) 변수처럼 다루면 군집화(clustering) 결과가 왜곡될 수 있다는 것입니

  7. K-평균(K-Means) 알고리즘 작동 원리 완벽 정리

    K-평균 알고리즘이란?K-평균(k-means) 알고리즘은 입력 매개변수 k를 받아 n개의 객체를 k개의 클러스터로 분할하는 대표적인 군집화 기법입니다. 이때 클러스터 내부의 유사도(intracluster similarity)는 최대한 높아지고, 서로 다른 클러스터 간의 유사도(intercluster similarity)는 최대한 낮아지도록 분할합니다.클러스터 유사도는 해당 클러스터에 속한 객체들의 평균값을 기준으로 계산됩니다. 이 평균값은 클러스터의 중심(centroid) 또는 무게중심(center of gravity)으로 해석할

  8. ROCK 알고리즘이란 무엇일까? 링크 기반 범주형 데이터 군집화 완벽 정리

    ROCK 알고리즘의 정의ROCK은 링크를 활용한 견고한 군집화(Robust Clustering using Links)의 약자로, 계층적 군집화(hierarchical clustering) 알고리즘의 하나입니다. 이 알고리즘은 범주형(categorical) 속성을 가진 데이터를 대상으로, 두 객체 간 공통 이웃 수를 의미하는 링크(link) 개념을 분석합니다. 단순한 거리 기반 측정만으로는 범주형 데이터를 고품질의 클러스터로 묶기 어렵다는 점을 보여준 것이 ROCK의 핵심 기여입니다.기존 군집화 방식의 한계대부분의 군집화 알고리즘은

  9. DBSCAN이란? 밀도 기반 군집화 알고리즘의 핵심 개념과 동작 원리

    DBSCAN이란 무엇인가?DBSCAN(Density-Based Spatial Clustering of Applications with Noise)은 노이즈를 고려한 밀도 기반 공간 클러스터링을 의미하는 밀도 기반 군집화 알고리즘입니다. 이 알고리즘은 충분히 높은 밀도를 가진 영역을 클러스터로 확장해 나가며, 노이즈가 섞여 있는 공간 데이터베이스에서도 임의의 모양을 가진 클러스터를 찾아냅니다. DBSCAN에서 하나의 클러스터는 밀도 연결(density-connected)된 점들의 최대 집합으로 표현됩니다.K-평균(K-Means)과 같

  10. DENCLUE(덴클루) 클러스터링이란? 개념, 원리, 장점까지 한눈에

    클러스터링(군집화)은 지식 발견(Knowledge Discovery)을 위한 핵심 데이터 마이닝 기법 중 하나입니다. 탐색적 데이터 분석 방법의 일종으로, 여러 데이터 객체를 클러스터라고 불리는 유사한 그룹으로 분류하는 작업을 말합니다. DENCLUE의 정의 DENCLUE는 밀도 기반 군집화(Density-based Clustering)를 의미하는 알고리즘으로, 일련의 밀도 분포 함수에 기반한 군집화 기법입니다. DENCLUE 알고리즘은 커널 밀도 추정(kernel density estimation)에 기반한 군집 모델을 사용하며

  11. STING(스팅) 클러스터링이란? 그리드 기반 다중 해상도 군집화 기법 총정리

    STING(Statistical Information Grid)란?STING은 Statistical Information Grid(통계 정보 그리드)의 약자로, 공간 데이터 마이닝에서 활용되는 그리드 기반 다중 해상도(multiresolution) 군집화 기법입니다. STING은 공간 영역을 사각형 셀(rectangular cell) 단위로 분할하며, 서로 다른 해상도에 해당하는 여러 종류의 셀이 계층 구조(hierarchical structure)를 이룹니다. 즉, 상위 레벨의 각 셀은 다음 하위 레벨의 여러 셀로 세분화되어 전체

  12. 닫힌 빈번 항목집합(Closed Frequent Itemset)을 효율적으로 마이닝하는 방법

    닫힌 빈번 항목집합 마이닝의 기본 접근법가장 단순한(naïve) 방법은 전체 빈번 항목집합을 모두 추출한 뒤, 이미 발견된 빈번 항목집합의 진부분집합(proper subset)이면서 동일한 지지도를 가지는 항목집합들을 제거하는 것입니다.그러나 이 방식은 길이 100짜리 빈번 항목집합 하나를 얻기 위해서도 2100−1개에 달하는 빈번 항목집합을 모두 생성해야 하며, 그 후에야 중복 항목집합 제거 작업을 시작할 수 있습니다. 따라서 권장되는 기법은 마이닝 단계에서 곧바로 닫힌 빈번 항목집합을 탐색하는 것입니다. 이를 위해서는

  13. 연관 규칙 클러스터링 시스템의 핵심 단계 완벽 정리

    연관 규칙 클러스터링 시스템이란?연관 규칙 클러스터링 시스템(Association Rule Clustering System)은 대량의 데이터에서 유용한 연관 규칙을 효율적으로 도출하기 위한 방법론입니다. 이 시스템은 크게 빈닝(Binning)과 빈발 술어 집합 찾기(Finding Frequent Predicate Sets)라는 두 가지 핵심 단계로 구성됩니다.1단계: 빈닝(Binning)정량적 속성(quantitative attributes)은 해당 도메인을 나타내는 매우 넓은 범위의 값을 가질 수 있습니다. 예를 들어, 나이와 소

  14. 제약 기반 연관 마이닝(Constraint-Based Mining)이란? 개념과 주요 제약 조건 완벽 정리

    제약 기반 연관 마이닝의 개념데이터 마이닝 절차를 수행하면 주어진 데이터 집합에서 수천 개에 달하는 규칙을 발견할 수 있습니다. 그러나 그중 대부분은 사용자에게 무의미하거나 지루한 결과에 그치는 경우가 많습니다. 사용자는 어떤 방향으로 마이닝을 진행해야 흥미로운 패턴을 찾을 수 있는지, 그리고 어떤 형태의 패턴이나 규칙을 발견하고 싶은지에 대해 가장 잘 알고 있습니다.따라서 효과적인 휴리스틱(heuristic) 방법은 사용자가 가진 직관이나 기대를 제약 조건(constraint)으로 정의하여 탐색 공간을 한정하는 것입니다. 바로 이

  15. 데이터 마이닝에서 메타룰(Metarule)이 유용한 이유와 활용 방법

    데이터 마이닝이란 무엇인가?데이터 마이닝(Data Mining)은 저장소에 축적된 대량의 데이터 속에서 통계학·수학 기법을 포함한 패턴 인식 기술을 활용하여 유용한 새로운 상관관계, 패턴, 추세를 발견하는 과정입니다. 이는 사실에 기반한 데이터셋을 분석해 예상치 못한 관계를 찾아내고, 데이터 소유자에게 논리적이면서도 실질적으로 도움이 되는 새로운 방식으로 레코드를 요약하는 작업입니다.동시에 데이터 마이닝은 방대한 양의 정보를 선택·탐색·모델링하여, 처음에는 알려지지 않았던 규칙성이나 관계를 찾아냄으로써 데이터베이스 소유자에게 명확하

  16. 규칙 제약 조건을 활용해 검색 공간을 효율적으로 정리하는 방법

    규칙 제약 조건의 분류데이터 마이닝에서 규칙 제약 조건(rule constraint)은 검색 공간을 효과적으로 줄이는 강력한 도구입니다. 이러한 제약 조건은 속성에 따라 다음과 같은 다섯 가지 유형으로 분류할 수 있습니다.1. 반단조 제약 조건(Antimonotonic Constraint)첫 번째 유형은 반단조(antimonotonic) 제약 조건입니다. 예를 들어 sum(I.price) ≤ 100이라는 제약 조건을 생각해 봅시다. Apriori 프레임워크를 사용하는 경우, 매 k번째 반복에서 크기가 k인 항목 집합(itemset)

  17. 데이터 분류는 어떻게 이루어질까? 분류의 개념과 2단계 프로세스 완벽 정리

    분류(Classification)란 무엇인가?분류(Classification)는 데이터 마이닝 기법의 하나로, 데이터 집합 내 요소들을 특정 범주에 할당함으로써 더 효율적인 예측과 분석을 돕는 방법입니다. 분류는 일반적으로 두 개의 목표 클래스가 존재하는 경우에 사용되며, 이를 이진 분류(binary classification)라고 합니다.반면 두 개보다 많은 클래스를 예측해야 하는 경우, 특히 패턴 인식(pattern recognition) 문제에서는 다항 분류(multinomial classification)로 정의됩니다. 다항

  18. 결정 트리(Decision Tree)란? 분류 문제 해결의 핵심 원리와 활용법

    결정 트리란 무엇인가?결정 트리 유도(decision tree induction)는 클래스 레이블이 붙어 있는 학습 데이터(훈련 튜플)로부터 결정 트리를 학습하는 과정을 말합니다. 결정 트리는 순서도(flowchart)와 유사한 트리 구조로, 각 내부 노드(internal node)는 특정 속성에 대한 검증(test)을 나타내고, 각 분기(branch)는 그 검증의 결과를 의미하며, 각 잎 노드(leaf node 또는 terminal node)는 하나의 클래스 레이블을 나타냅니다. 트리의 최상위에 위치한 노드를 루트 노드(root

  19. 속성 선택 측정이란? 정보 획득량·이득 비율·지니 지수 핵심 정리

    속성 선택 측정이란 무엇인가?속성 선택 측정(attribute selection measure)은 클래스 레이블이 부여된 학습 튜플로 구성된 데이터 파티션 D를 개별 클래스별로 가장 잘 분리하는 분할 검사(splitting test)를 고르기 위한 휴리스틱(경험적 판단 기준)입니다.분할 기준에 따라 D가 더 작은 파티션으로 나뉘었을 때, 이상적으로는 모든 파티션이 순수(pure)해야 합니다. 즉, 특정 파티션에 속한 튜플들이 모두 동일한 클래스에 속하는 상태가 가장 바람직합니다.개념적으로 최선의 분할 기준이란 바로 그러한 순수한 분

  20. 베이지안 믿음 네트워크는 어떻게 학습할까? 핵심 원리 완벽 정리

    베이지안 분류기란 무엇인가?베이지안 분류기(Bayesian Classifier)는 통계적 분류기의 한 종류로, 주어진 샘플이 특정 클래스에 속할 확률을 포함한 클래스 소속 확률을 예측합니다. 베이지안 분류기는 대규모 데이터베이스를 다룰 때에도 뛰어난 효율성과 빠른 처리 속도를 발휘하는 것이 특징입니다.분류 규칙의 학습 과정클래스가 정의되면 시스템은 분류를 지배하는 규칙을 추론해야 하며, 이를 위해 각 클래스에 대한 설명(description)을 찾아낼 수 있어야 합니다. 이 설명은 반드시 훈련 세트의 예측 속성만을 참조해야 하며,

Total 1478 -컴퓨터  FirstPage PreviousPage NextPage LastPage CurrentPage:38/74  20-컴퓨터/Page Goto:1 32 33 34 35 36 37 38 39 40 41 42 43 44