Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

프로그래밍

  1. 데이터 마이닝의 핵심 응용 분야 4가지 총정리

    데이터 마이닝(Data Mining)은 패턴 인식 기술과 통계·수학적 기법을 활용하여 대규모 데이터 저장소에 축적된 데이터를 심층 분석함으로써, 의미 있는 새로운 상관관계·패턴·추세를 발견하는 과정입니다.즉, 관측된 데이터셋을 분석해 예상치 못한 관계를 찾아내고, 데이터 소유자가 이해하기 쉬우면서도 실질적으로 유익한 형태로 기록을 요약하는 작업이라 할 수 있습니다. 데이터 마이닝은 다양한 분야에서 활용되고 있으며, 대표적인 응용 분야는 다음과 같습니다.1. 데이터 웨어하우스와 데이터 전처리데이터 웨어하우스는 정보 교환과 데이터 마이

  2. 주기성 분석이란 무엇일까? 개념부터 주기 패턴의 유형까지 한눈에

    주기성 분석이란 무엇인가?주기성 분석(periodicity analysis)은 주기 패턴 마이닝(periodic pattern mining)이라고도 불리며, 시간과 관련된 시계열 데이터 속에서 반복적으로 나타나는 패턴을 발견하는 데이터 마이닝 기법입니다.주기성 분석은 다양한 중요한 분야에서 활용됩니다. 예를 들어 계절의 변화, 바다의 밀물과 썰물, 행성의 운행 궤적, 하루 동안의 전력 소비량, 일일 교통 패턴, 주간 TV 편성표처럼 특정 주기를 가지고 반복되는 현상들이 모두 주기 패턴의 좋은 예입니다.주기성 분석의 대상이 되는 데이

  3. 빈번한 부분 구조(Frequent Substructure) 발견 방법 완벽 가이드

    빈번한 부분 구조 발견의 기본 원리빈번한 부분 구조(frequent substructure)의 발견은 일반적으로 두 단계로 이루어집니다. 첫 번째 단계에서는 빈번한 부분 구조 후보를 생성하고, 두 번째 단계에서는 각 후보의 빈도를 검사합니다.대부분의 연구가 첫 번째 단계의 최적화에 집중되는 이유는, 두 번째 단계가 부분 그래프 동형성(subgraph isomorphism) 검사를 포함하며 이 검사의 계산 복잡도가 지나치게 높기 때문입니다(NP-완전 문제).빈번한 부분 구조 마이닝의 주요 방법빈번한 부분 구조를 마이닝하는 방법은 크게

  4. 소셜 네트워크란 무엇일까? 핵심 개념과 3가지 특징 총정리

    소셜 네트워크(social network)는 그래프(graph)로 표현되는 이질적이고 다중 관계적인 정보 집합입니다. 이 그래프는 일반적으로 매우 방대한 규모를 가지며, 노드(node)는 객체에 해당하고 엣지(edge)는 객체 사이의 관계나 연결을 나타냅니다. 노드와 연결은 모두 속성(attribute)을 가질 수 있으며, 객체에는 클래스 레이블이 부여될 수도 있습니다. 또한 링크는 단방향일 수 있고, 반드시 이진(binary) 형태일 필요는 없습니다.소셜 네트워크의 주요 특징소셜 네트워크는 다음과 같은 세 가지 특징적인 성질을 보

  5. 링크 마이닝의 핵심 작업 6가지 완벽 정리

    링크 마이닝(Link Mining)은 데이터 객체들 사이의 연결 관계를 분석하고 활용하는 데이터 마이닝 기법으로, 여러 가지 중요한 작업을 포함합니다. 대표적인 작업들을 하나씩 살펴보겠습니다.1. 링크 기반 객체 분류 (Link-based Object Classification)전통적인 분류 방식에서는 객체를 정의하는 속성만을 기준으로 분류를 수행합니다. 반면 링크 기반 분류는 객체 자체의 속성뿐만 아니라 해당 객체가 가진 링크, 그리고 링크로 연결된 객체들의 속성까지 함께 고려하여 범주를 예측합니다.웹 페이지 분류는 링크 기반 분

  6. 링크 마이닝의 주요 과제는 무엇일까? 6가지 핵심 문제 정리

    링크 마이닝(link mining)은 소셜 네트워크, 웹 그래프, 인용 네트워크처럼 객체들이 서로 연결된 데이터를 분석하는 기법입니다. 하지만 강력한 만큼 해결해야 할 여러 가지 도전 과제가 존재합니다. 지금부터 링크 마이닝의 대표적인 6가지 문제점을 하나씩 살펴보겠습니다.1. 논리적 종속성 vs 통계적 종속성그래프 구조 안에는 두 가지 유형의 종속성이 공존합니다. 하나는 객체 간의 논리적 관계를 나타내는 링크 구조이고, 다른 하나는 객체 속성 간의 상관관계 같은 확률적(통계적) 종속성입니다.문제는 이 두 종속성을 일관되게 처리하기

  7. 다중 관계형 데이터 마이닝(MRDM)이란? 개념부터 핵심 기법까지 한눈에 보기

    다중 관계형 데이터 마이닝의 기본 개념다중 관계형 데이터 마이닝(Multi-Relational Data Mining, MRDM)은 관계형 데이터베이스 내의 여러 테이블(관계, relation)에 걸쳐 있는 패턴을 탐색하는 방법론입니다. 각 테이블은 하나의 엔티티(entity) 또는 관계(relationship)를 나타내며, 일련의 속성(attribute) 집합으로 그 특성이 기술됩니다. 또한 테이블 간의 링크(link)는 이들 사이의 관계를 표현합니다.기존 데이터 마이닝 방식의 한계와 명제화(Propositionalization)전

  8. 다중 관계형 클러스터링이란 무엇인가? 개념과 CrossClus 알고리즘 완벽 정리

    다중 관계형 클러스터링의 정의다중 관계형 클러스터링(multi-relational clustering)은 여러 관계(relation)에 분산되어 있는 정보를 활용하여, 데이터 객체들을 유사도(similarity)를 기준으로 여러 클러스터로 나누는 기법입니다. 단일 테이블만을 대상으로 하는 전통적인 클러스터링과 달리, 관계형 데이터베이스 전체에 걸쳐 있는 정보를 종합적으로 활용할 수 있다는 점이 큰 특징입니다.대표적인 알고리즘으로는 CrossClus(Cross-relational Clustering with user guidance)

  9. 객체의 상속된 속성도 일반화할 수 있을까? — 객체 지향 데이터베이스의 일반화 원리

    객체 지향 데이터베이스에서는 클래스와 하위 클래스가 계층 구조로 조직되어 있기 때문에, 객체의 일부 속성이나 메서드는 해당 클래스에 직접 정의되어 있지 않고 상위 클래스로부터 상속됩니다. 그렇다면 이렇게 상속된 속성도 데이터 일반화의 대상이 될 수 있을까요? 결론부터 말하면 가능합니다. 아래에서 그 원리를 단계별로 살펴보겠습니다.객체 식별자의 일반화 과정객체 식별자(object identifier)는 다음과 같은 방식으로 일반화됩니다. 먼저 객체 식별자를 해당 객체가 속한 가장 낮은 수준의 하위 클래스(subclass) 식별자로 일

  10. 공간 데이터 마이닝(Spatial Data Mining)이란? 개념부터 핵심 원리까지 한눈에

    공간 데이터베이스는 지도, 전처리된 원격 탐사(remote sensing) 기록, 의료 영상 데이터, VLSI 칩 설계 데이터 등 방대한 양의 공간 관련 정보를 저장합니다. 공간 데이터베이스는 일반적인 관계형 데이터베이스와 구별되는 몇 가지 특징을 지니는데, 대표적으로 위상(topology) 정보나 거리 정보를 포함하며, 정교한 다차원 공간 인덱싱 구조로 조직되고 공간 데이터 접근 방식을 통해 처리된다는 점입니다. 또한 공간 추론, 기하학적 계산, 공간 지식 표현 기법을 필요로 하는 경우가 많습니다.공간 데이터 마이닝의 정의공간 데

  11. 공간 데이터 웨어하우스 구축과 활용의 핵심 과제는 무엇일까?

    공간 데이터 웨어하우스 구축과 활용의 주요 과제공간 데이터 웨어하우스(spatial data warehouse)를 구축하고 활용하는 과정에서는 여러 가지 어려운 문제에 직면하게 됩니다. 첫 번째 과제는 이기종(heterogeneous) 소스와 시스템으로부터 공간 정보를 통합하는 것입니다. 공간 데이터는 일반적으로 다양한 산업 분야의 기업과 정부 기관에서 서로 다른 데이터 형식으로 저장되고 있기 때문입니다.데이터 형식은 구조 측면에서도(예: 래스터 방식과 벡터 방식의 공간 데이터, 객체 지향 모델과 관계형 모델, 서로 다른 공간 저장

  12. 웨이블릿 변환이 클러스터링에 유용한 이유는 무엇일까?

    웨이블릿 변환과 WaveCluster의 원리WaveCluster는 데이터 공간에 다차원 격자(grid) 구조를 적용하여 레코드를 먼저 요약하는 멀티해상도(multiresolution) 클러스터링 알고리즘입니다. 이 알고리즘은 웨이블릿 변환(wavelet transform)을 활용해 원래의 특징 공간(feature space)을 변환하고, 변환된 공간에서 밀집 영역(dense region)을 찾아냅니다.이 방식에서는 각 격자 셀이 해당 셀에 매핑된 점들의 그룹 데이터를 요약합니다. 요약된 데이터는 일반적으로 주 메모리에 저장될 만큼

  13. 기댓값-최대화(EM) 알고리즘이란 무엇인가?

    기댓값-최대화(EM) 알고리즘의 개념기댓값-최대화(Expectation-Maximization, EM) 알고리즘은 모수(parameter) 추정치를 찾아내는 데 널리 사용되는 대표적인 반복적 개선(iterative refinement) 알고리즘입니다. EM은 k-평균(k-means) 패러다임의 확장으로 볼 수 있는데, k-평균에서는 군집 평균을 기준으로 각 객체를 가장 유사한 군집에 할당하는 방식을 사용합니다.반면 EM은 각 객체를 소속 확률(membership probability)을 나타내는 가중치에 따라 군집에 배정합니다. 다

  14. 개념적 클러스터링(Conceptual Clustering)이란? 핵심 원리부터 COBWEB 알고리즘까지

    개념적 클러스터링(conceptual clustering)은 머신러닝에서 사용되는 클러스터링 기법의 하나로, 레이블이 없는(unlabeled) 객체 집합이 주어졌을 때 이들 객체에 대한 분류 체계를 만들어내는 방식입니다.일반적인 클러스터링이 유사한 객체들의 그룹을 식별하는 데 그치는 것과 달리, 개념적 클러스터링은 한 단계 더 나아가 각 그룹에 대한 특징적 정의까지 발견합니다. 즉, 각 그룹은 단순한 객체의 모음이 아니라 하나의 개념(concept) 또는 클래스(class)를 정의하게 됩니다.개념적 클러스터링의 2단계 프로세스개념적

  15. 제약 조건 기반 클러스터링의 유형은 무엇일까?

    제약 조건 기반 클러스터링이란?제약 조건 기반 클러스터링(Constraint-based Clustering)은 사용자가 명시한 선호 사항이나 제약 조건을 만족하는 클러스터를 찾는 기법입니다. 제약 조건의 성격에 따라 다양한 접근 방식을 취할 수 있으며, 제약 조건은 크게 다음과 같은 범주로 나눌 수 있습니다.1. 개별 객체에 대한 제약 조건클러스터링 대상이 되는 객체 자체에 제약 조건을 정의할 수 있습니다. 예를 들어 부동산 애플리케이션에서는 가치가 100만 달러 이상인 고급 저택만을 대상으로 공간적 클러스터링을 수행하고 싶을 수

  16. 반지도 클러스터링(Semi-Supervised Clustering)이란? 핵심 개념과 주요 기법 총정리

    반지도(semi-supervised) 클러스터링은 도메인 지식을 활용하여 레이블이 없는 데이터를 군집화하는 방법입니다. 도메인 지식은 일반적으로 인스턴스 간의 쌍별 제약 조건(pairwise constraints) 형태로 표현되거나, 추가로 제공되는 레이블이 지정된 인스턴스 집합의 형태로 표현됩니다.반지도 클러스터링의 핵심 개념비지도(unsupervised) 클러스터링만으로는 데이터의 숨겨진 구조를 완벽하게 파악하기 어려운 경우가 많습니다. 하지만 약한 형태의 감독 정보, 예컨대 동일한 클러스터에 속한다 또는 서로 다른 클러스터에

  17. 거리 기반 이상값(DB Outlier)이란? 개념부터 주요 탐지 알고리즘까지

    거리 기반 이상값(DB Outlier)의 정의데이터 집합 S에 속한 객체 o가 매개변수 p와 d를 갖는 거리 기반(distance-based, DB) 이상값, 즉 DB(p, d)가 되려면, S 내 객체들 중 최소 비율 p만큼의 객체들이 o로부터 거리 d보다 먼 위치에 있어야 합니다.다시 말해, 통계적 검정에 의존하는 대신 충분한 이웃을 확보하지 못한 객체를 이상값으로 간주하는 방식입니다. 여기서 이웃(neighbors)은 해당 객체로부터의 거리를 기준으로 정의됩니다.통계 기반 방법과의 관계통계 기반 방법과 비교했을 때, 거리 기반

  18. BIRCH 클러스터링 알고리즘 완벽 이해하기

    BIRCH란 무엇인가?BIRCH는 Balanced Iterative Reducing and Clustering Using Hierarchies(계층 구조를 활용한 균형 잡힌 반복 축소 및 군집화)의 약자입니다. 계층적 클러스터링(hierarchical clustering)과 반복적 분할(iterative partitioning) 등 다른 클러스터링 기법들을 통합하여, 방대한 양의 수치 데이터를 효율적으로 군집화하도록 설계된 알고리즘입니다.BIRCH는 클러스터링 특징(Clustering Feature, CF)과 클러스터링 특징 트리(

  19. 회프딩 트리(Hoeffding Tree) 알고리즘이란? 스트림 데이터 분류의 핵심 원리

    회프딩 트리 알고리즘이란?회프딩 트리(Hoeffding Tree) 알고리즘은 스트림 데이터(stream data) 분류를 위해 고안된 의사결정 트리 학습 방법입니다. 처음에는 웹 클릭스트림(clickstream)을 추적하고, 사용자가 어떤 웹 호스트나 웹 사이트에 접속할 가능성이 높은지 예측하는 모델을 구축하는 데 활용되었습니다.이 알고리즘은 일반적으로 선형 미만(sublinear) 시간 안에 실행되며, 전통적인 배치(batch) 학습 방법이 생성하는 것과 거의 동일한 의사결정 트리를 만들어낸다는 점에서 큰 강점을 가집니다.핵심 아

  20. CluStream이란? 진화하는 데이터 스트림 클러스터링 알고리즘 총정리

    CluStream 알고리즘 개요CluStream은 사용자가 지정한 온라인 클러스터링 질의에 기반하여 끊임없이 변화하는(진화하는) 데이터 스트림을 클러스터링하기 위한 알고리즘입니다. 이 알고리즘의 핵심 아이디어는 전체 클러스터링 프로세스를 온라인(online) 단계와 오프라인(offline) 단계로 분리하는 것입니다.온라인 구성 요소와 오프라인 구성 요소온라인 구성 요소는 마이크로 클러스터(micro-cluster)를 활용해 데이터 스트림에 대한 요약 통계를 실시간으로 계산하고 저장하며, 이를 점진적으로(incrementally) 갱

Total 1478 -컴퓨터  FirstPage PreviousPage NextPage LastPage CurrentPage:50/74  20-컴퓨터/Page Goto:1 44 45 46 47 48 49 50 51 52 53 54 55 56