Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

프로그래밍

  1. 그래프 및 네트워크 마이닝이란? 핵심 개념과 5가지 주요 응용 분야

    그래프와 네트워크의 이해그래프(graph)는 집합, 시퀀스, 격자(lattice), 트리(tree)보다 더 일반적인 범주의 데이터 구조를 표현할 수 있는 강력한 메커니즘입니다. 하나의 그래프만으로도 복잡한 관계와 위계 구조를 자연스럽게 담아낼 수 있기 때문입니다.실제로 그래프는 인터넷과 소셜 네트워크, 데이터 네트워크, 생물학적 웹, 바이오인포매틱스(생물정보학), 화학 정보학, 컴퓨터 비전, 멀티미디어 및 콘텐츠 검색 등 방대한 영역에서 폭넓게 활용되고 있습니다.그래프·네트워크 마이닝의 주요 응용 분야1. 그래프 패턴 마이닝(Gra

  2. 명목 데이터의 개념 계층을 생성하는 4가지 방법

    명목 데이터 개념 계층 생성 방법명목 데이터(nominal data)에 대한 개념 계층(concept hierarchy)을 생성하는 방법은 크게 네 가지로 나눌 수 있습니다. 각 방법은 사용자의 참여 정도와 시스템의 자동화 수준에 따라 차이가 있으며, 상황에 맞게 선택하여 활용할 수 있습니다.1. 스키마 수준에서 속성 간 부분 순서를 명시적으로 정의명목 속성이나 차원에 대한 개념 계층은 일반적으로 여러 속성의 집합으로 구성됩니다. 사용자나 전문가는 스키마 수준에서 속성들 간의 부분 순서 또는 전체 순서를 직접 정의함으로써 개념 계층

  3. 조직은 데이터 웨어하우스의 정보를 어떻게 활용하고 있을까?

    데이터 웨어하우스란 무엇인가?데이터 웨어하우징(Data Warehousing)은 여러 소스에서 데이터를 수집하고 관리하여 기업에 중요한 비즈니스 인사이트를 제공하는 접근 방식입니다. 데이터 웨어하우스는 경영진의 의사결정을 지원하도록 특별히 설계된 시스템입니다.쉽게 말해, 데이터 웨어하우스는 조직의 운영(OLTP) 데이터베이스와 독립적으로 유지 관리되는 데이터베이스를 의미합니다. 데이터 웨어하우스 시스템은 여러 애플리케이션 시스템의 통합을 가능하게 하며, 분석에 적합한 통합된 과거 데이터를 담은 견고한 플랫폼을 제공함으로써 데이터 처

  4. 데이터 마이닝과 정보 처리·OLAP(온라인 분석 처리)의 관계 총정리

    데이터 웨어하우스 응용 프로그램은 크게 정보 처리(Information Processing), 분석 처리(Analytical Processing), 데이터 마이닝(Data Mining) 세 가지 유형으로 나눌 수 있습니다. 이 세 가지는 서로 다른 목적과 기능을 가지지만, 데이터로부터 가치를 추출한다는 공통점을 지니고 있습니다.1. 정보 처리(Information Processing)정보 처리는 질의(query)를 기반으로 기본적인 수치 분석과 문서화를 수행하는 기능입니다. 교차표(crosstab), 표, 차트, 그래프 등을 활용해

  5. 데이터 큐브 효율적 계산을 위한 핵심 최적화 기법 4가지

    데이터 큐브 계산을 위한 주요 최적화 기법데이터 웨어하우스와 OLAP 환경에서 데이터 큐브(data cube)를 효율적으로 계산하려면 대규모 데이터셋을 처리하기 위한 최적화 기술이 반드시 필요합니다. 아래에서는 데이터 큐브 연산의 성능을 크게 향상시키는 대표적인 기법 네 가지를 살펴봅니다.1. 정렬, 해싱, 그룹화(Sorting, Hashing, Grouping)차원 속성에 정렬, 해싱, 그룹화 연산을 적용하면 관련된 튜플(tuple)을 재배열하고 클러스터링할 수 있습니다. 큐브 계산에서 집계(aggregation)는 동일한 차원

  6. 패턴 마이닝의 주요 응용 분야 완벽 정리

    패턴 마이닝이란 무엇인가?패턴 마이닝(Pattern Mining)은 대규모 데이터 속에서 반복적으로 나타나는 패턴을 발견하는 데이터 마이닝의 핵심 기법입니다. 단순히 빈번한 항목 집합을 찾는 것을 넘어, 데이터 정제부터 고급 분석에 이르기까지 폭넓은 분야에서 활용되고 있습니다. 이 글에서는 패턴 마이닝의 대표적인 응용 분야를 하나씩 살펴보겠습니다.1. 데이터 전처리: 노이즈 필터링과 데이터 정제패턴 마이닝은 여러 데이터 집약적 애플리케이션에서 노이즈 필터링과 데이터 클리닝을 담당하는 전처리 단계로 널리 사용됩니다. 예를 들어 수만

  7. 데이터 시각화로 대화형 의사결정 트리 구축하기: PBC 방법 완벽 이해

    지각 기반 분류(PBC)란 무엇인가?지각 기반 분류(Perception-Based Classification, PBC)는 다차원 시각화 기법에 기반한 대화형 분류 방법으로, 사용자가 의사결정 트리를 구축하는 과정에서 데이터에 대한 배경 지식을 직접 반영할 수 있도록 지원합니다.데이터와 시각적으로 상호작용함으로써 사용자는 데이터에 대한 더 깊은 이해를 얻게 됩니다. 그 결과 만들어지는 트리는 전통적인 의사결정 트리 유도(decision tree induction) 기법으로 생성한 것보다 작아서 해석이 훨씬 쉬우면서도, 거의 비슷한 수

  8. 베이지안 믿음 네트워크(Bayesian Belief Network)란? 개념부터 구성 요소까지 총정리

    베이지안 믿음 네트워크의 등장 배경나이브 베이즈 분류기(Naïve Bayesian Classifier)는 클래스 조건부 독립(class conditional independence) 가정을 전제로 합니다. 즉, 튜플의 클래스 레이블이 주어졌을 때 각 속성값들은 서로 조건부로 독립이라고 가정하는데, 이를 통해 계산 과정이 크게 단순화됩니다.이 가정이 실제 데이터에서 참에 가까울 때, 나이브 베이즈 분류기는 다른 여러 분류기와 비교해도 매우 효율적으로 작동합니다. 하지만 현실 세계의 많은 변수들은 서로 독립적이지 않은 경우가 많습니다.

  9. 능동 학습(Active Learning)이란? 핵심 개념과 작동 원리 완벽 정리

    능동 학습(Active Learning)은 지도 학습의 한 형태로, 데이터는 충분하지만 클래스 레이블이 부족하거나 획득 비용이 많이 드는 상황에서 특히 유용합니다. 이 방식에서 학습 알고리즘은 사용자(예: 사람 오라클)에게 레이블을 능동적으로 질의할 수 있다는 점에서 능동적입니다. 그 결과, 하나의 개념을 학습하는 데 필요한 데이터 튜플 수가 일반적인 지도 학습보다 훨씬 적습니다.능동 학습의 목표능동 학습은 비용을 최소화하면서, 가능한 한 적은 레이블된 예제만으로 높은 정확도를 달성하는 것을 목표로 합니다. 전체 데이터 집합을 D라

  10. 고차원 데이터에서 부분공간 클러스터를 찾는 방법

    고차원 데이터를 클러스터링하는 방법은 크게 부분공간 탐색 기법, 상관관계 기반 클러스터링 기법, 바이클러스터링(Biclustering) 기법의 세 가지 그룹으로 분류할 수 있습니다.부분공간 탐색 기법(Subspace Search Technique)부분공간 탐색 방법은 여러 개의 부분공간을 검색하여 클러스터를 찾습니다. 따라서 클러스터란 특정 부분공간 안에서 서로 동일한 특성을 보이는 객체들의 부분집합이라 할 수 있습니다. 이때 유사도는 거리(distance)나 밀도(density)와 같은 전통적인 측정 기준을 통해 계산됩니다.대표적

  11. 이분 그래프란 무엇이며, 어떤 분야에 활용될까?

    이분 그래프(bipartite graph)는 정점들을 서로 겹치지 않는 두 개의 집합으로 나눌 수 있고, 모든 간선이 한쪽 집합의 정점과 다른 쪽 집합의 정점을 연결하는 그래프입니다.예를 들어 AllElectronics의 고객 구매 데이터를 살펴보겠습니다. 한쪽 집합의 정점은 사용자를 나타내며(정점 하나당 사용자 한 명), 다른 쪽 집합의 정점은 제품을 나타냅니다(정점 하나당 제품 하나). 그리고 간선은 사용자와 제품을 연결하여, 해당 사용자가 그 제품을 구매했음을 의미합니다.이러한 이분 그래프는 다양한 분야에서 실질적으로 활용되고

  12. 허브 페이지를 활용해 신뢰할 수 있는 웹페이지를 찾는 방법

    웹에서 신뢰할 수 있는 정보원을 찾는 데 유용한 개념이 바로 허브(hub)입니다. 허브란 권위 있는 페이지(authority)들을 가리키는 링크 집합을 담고 있는 웹페이지 모음을 의미합니다.허브 페이지의 특징허브 페이지 자체는 대체로 잘 알려져 있지 않거나, 이를 가리키는 외부 링크가 거의 없을 수 있습니다. 그러나 특정 주제에 관해 권위 있는 사이트들로 연결되는 링크를 다수 포함하고 있다는 점이 특징입니다. 예를 들어 개인 홈페이지의 추천 사이트 목록, 강좌 홈페이지가 소개하는 참고 자료 사이트, 상업 사이트에 전문적으로 정리된

  13. 웹 사용 마이닝(Web Usage Mining)이란 무엇일까?

    웹 사용 마이닝의 개념웹 사용 마이닝(Web Usage Mining)은 웹 로그 데이터로부터 유용한 데이터, 정보, 지식을 추출하는 기술로, 사용자가 웹 페이지에 접근하는 패턴을 파악하는 데 활용됩니다.웹 리소스를 관리하는 관점에서 보면, 관심 대상은 웹 서버 로그 형태로 기록되는 사이트 방문자들의 요청 데이터입니다. 웹 페이지 집합의 내용과 구조가 페이지 작성자의 의도를 반영한다면, 개별 요청 기록은 사용자가 실제로 이러한 페이지를 어떻게 이용하는지를 보여줍니다. 따라서 웹 사용 마이닝은 페이지 설계자가 예상하지 못했던 숨겨진 관

  14. 데이터 마이닝의 이론적 토대란 무엇일까? 핵심 이론 완벽 정리

    데이터 마이닝을 지탱하는 이론적 기반데이터 마이닝은 단일한 이론 위에 세워진 기술이 아니라, 여러 학문적 관점에서 그 기반을 설명할 수 있습니다. 대표적인 이론들을 하나씩 살펴보겠습니다.1. 데이터 축소(Data Reduction)이 이론에서는 데이터 마이닝의 본질을 데이터 표현의 축소로 봅니다. 방대한 데이터베이스에 대한 질의에 빠르고 근사적인 답변을 제공해야 한다는 요구에 대응하기 위해, 어느 정도의 정확성을 희생하는 대신 처리 속도를 얻는 것이 핵심입니다.대표적인 데이터 축소 기법으로는 특잇값 분해(SVD, 주성분 분석의 핵심

  15. 영상·음성 데이터 마이닝이란? 개념과 핵심 기법 완벽 정리

    시각적 데이터 마이닝(Visual Data Mining)의 개념시각적 데이터 마이닝은 데이터 및 지식 시각화 기법을 활용해 방대한 데이터 집합 속에 숨겨져 있는 유용한 지식을 발견하는 기술입니다. 인간의 시각 시스템은 눈과 뇌에 의해 작동하며, 특히 뇌는 방대한 지식 베이스를 갖춘 동적이고 고도로 병렬화된 처리·추론 엔진으로 볼 수 있습니다.시각적 데이터 마이닝은 데이터 시각화와 데이터 마이닝이라는 두 학문 분야가 융합된 형태로 이해할 수 있습니다. 아울러 컴퓨터 그래픽스, 멀티미디어 시스템, 휴먼-컴퓨터 상호작용(HCI), 패턴

  16. 개인 고객 데이터를 수집하는 기업으로부터 소비자를 보호하는 방법: 옵트아웃부터 암호화까지

    소비자를 위한 옵트아웃 선택지 제공개인 고객 데이터를 수집하는 기업이 소비자를 보호하는 한 가지 효과적인 해결책은 소비자에게 다양한 옵트아웃(opt-out) 선택지를 제공하는 것입니다. 이를 통해 소비자는 자신의 개인 정보가 어떻게 사용될 수 있는지 직접 제한을 설정할 수 있습니다.완전 거부: 소비자의 개인 데이터는 데이터 마이닝에 전혀 사용되지 않습니다.익명화 후 사용: 소비자의 데이터는 데이터 마이닝에 활용될 수 있으나, 개인의 신원을 식별할 수 있는 정보나 신원 노출로 이어질 가능성이 있는 데이터는 반드시 삭제됩니다.사내 전용

  17. 데이터 마이닝에서 파생 모델이 표현되는 방식 총정리

    분류 모델과 파생 모델의 개념분류(Classification)는 데이터 클래스나 개념을 정의하고 구분하는 모델을 발견하는 절차입니다. 이 모델은 학습 데이터(training data), 즉 클래스 레이블이 이미 알려져 있는 데이터 객체 집합을 분석하여 만들어집니다. 완성된 모델은 클래스 레이블이 알려지지 않은 객체에 대해서도 해당 레이블을 예측할 수 있습니다.파생 모델의 다양한 표현 형태이렇게 유도된 파생 모델(derived model)은 여러 가지 형태로 표현될 수 있습니다. 대표적인 형태로는 분류 규칙(classification

  18. 웹 검색 엔진이란? 개념부터 데이터 마이닝 과제까지 한눈에

    웹 검색 엔진의 정의 웹 검색 엔진(web search engine)은 웹상에 존재하는 방대한 데이터를 찾아내기 위해 특화된 컴퓨터 서버입니다. 사용자가 검색어를 입력하면 검색 엔진은 그에 맞는 결과를 목록 형태로 반환하는데, 이 결과 목록을 흔히 히트(hits)라고 부릅니다. 히트에는 웹 페이지뿐 아니라 이미지, 각종 문서 파일 등 다양한 유형의 자료가 포함될 수 있습니다. 검색 엔진과 웹 디렉터리의 차이 일부 검색 엔진은 공개 데이터베이스나 오픈 디렉터리에 있는 정보도 함께 검색해 제공합니다. 다만 검색 엔진과 웹 디렉터리는

  19. 데이터 마이닝 방법론의 6가지 핵심 측면

    데이터 마이닝 방법론은 단순한 데이터 분석을 넘어 여러 가지 중요한 측면을 포괄하는 폭넓은 개념입니다. 이 글에서는 데이터 마이닝 방법론을 구성하는 6가지 핵심 측면을 자세히 살펴보겠습니다.1. 다양하고 새로운 종류의 지식 마이닝데이터 마이닝은 데이터 특성화(characterization)와 판별(discrimination)부터 시작하여 관계 및 상관관계 분석, 분류, 회귀, 군집화, 이상치 탐지, 시퀀스 분석, 추세 및 계산 분석에 이르기까지 광범위한 데이터 분석과 지식 발견 서비스를 다룹니다.이러한 서비스들은 동일한 데이터베이스

  20. 데이터 속성(Attribute)이란? 개념부터 4가지 유형까지 한눈에 정리

    속성(Attribute)의 정의속성(attribute)은 데이터 객체가 가진 특성을 정의하는 데이터 필드를 의미합니다. 학술 문헌에서는 속성, 차원(dimension), 특징(feature), 변수(variable)라는 용어들이 서로 혼용되어 사용되는데, 일반적으로 데이터 웨어하우스 분야에서는 차원, 머신러닝 분야에서는 특징(feature), 통계학 분야에서는 변수(variable), 그리고 데이터 마이닝과 데이터베이스 분야에서는 속성이라는 용어를 주로 사용합니다.예를 들어 고객이라는 객체를 정의하는 속성에는 고객 ID, 이름, 주

Total 1478 -컴퓨터  FirstPage PreviousPage NextPage LastPage CurrentPage:36/74  20-컴퓨터/Page Goto:1 30 31 32 33 34 35 36 37 38 39 40 41 42