Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

프로그래밍

  1. 분류기 성능 평가 방법 완벽 정리: 홀드아웃, 랜덤 서브샘플링, 교차 검증

    모델 일반화 오차 추정의 중요성머신러닝에서는 학습 과정 중에 모델의 일반화 오차(generalization error)를 추정하는 여러 가지 방법이 사용됩니다. 이렇게 추정된 오차는 학습 알고리즘이 적절한 복잡도를 가진, 즉 과적합(overfitting)의 영향을 받지 않는 모델을 선택하는 데 중요한 근거가 됩니다.모델이 구축된 후에는 테스트 세트(test set)를 활용하여 이전에 한 번도 본 적 없는 데이터의 클래스 레이블을 예측할 수 있습니다. 테스트 세트에서 측정한 성능은 모델의 일반화 오차에 대한 편향되지 않은(unbias

  2. 데이터 마이닝에서 예측 변수 수를 줄여야 하는 이유와 방법

    데이터 마이닝에서 예측 변수 선택의 중요성데이터 마이닝에서 자주 마주치는 문제 중 하나는 종속변수의 값을 예측하기 위해 회귀식을 활용할 때, 모델에 포함할 수 있는 후보 예측 변수가 너무 많다는 점입니다.게다가 여러 변수를 포함하면 기존에 숨겨져 있던 관계가 드러날 것이라는 기대도 변수 증가를 부추깁니다. 실제로 어떤 기업은 의자와 테이블 다리 보호용 스크래치 방지 커버를 구매한 고객의 신용 위험이 더 낮다는 사실을 발견한 사례가 있습니다.하지만 가능한 모든 변수를 모델에 무분별하게 투입하기 전에 신중을 기해야 할 이유는 여럿 있습

  3. K-최근접 이웃(KNN) 알고리즘이란? 개념과 원리 쉽게 이해하기

    K-최근접 이웃(K-Nearest Neighbors, KNN) 알고리즘은 클래스 소속 여부(Y)와 예측 변수 X1, X2, …, Xn 사이의 관계 구조에 대해 어떠한 가정도 하지 않는 분류 기법입니다.KNN은 비모수적(nonparametric) 접근법KNN은 선형 회귀에서처럼 특정 함수 형태를 미리 가정하고 그 안에서 매개변수를 추정하는 방식이 아니기 때문에 비모수적(nonparametric) 방법으로 분류됩니다. 대신 이 알고리즘은 데이터셋 내 예측 변수 값들 간의 유사성(similarity)을 기반으로 작동합니다.KNN의 핵심

  4. k-NN 알고리즘의 이점과 한계 총정리

    k-최근접 이웃(k-Nearest Neighbors, k-NN) 알고리즘은 클래스 소속 여부(Y)와 예측 변수 X1, X2, …, Xn 사이의 관계 구조에 대해 어떠한 가정도 하지 않는 분류 기법입니다.비모수적 접근 방식k-NN은 선형 회귀에서 가정하는 것처럼 특정 함수 형태(예: 선형 형태)를 전제로 매개변수를 추정하지 않는 비모수(nonparametric) 방법입니다. 대신 데이터셋 내 예측 변수 값들 간의 유사성을 바탕으로 데이터를 분류합니다.k-NN 알고리즘의 주요 이점k-NN 방법의 가장 큰 장점은 단순함과 모수적 가정이

  5. 판별 분석의 성능은 어떻게 평가할까?

    ```html 판별 분석의 두 가지 핵심 가정판별 분석(discriminant analysis)은 분류 점수를 산출하기 위해 두 가지 주요 가정에 기반합니다. 첫 번째 가정은 각 클래스 내 예측 변수(predictor) 측정값이 다변량 정규분포(multivariate normal distribution)를 따른다는 것입니다. 이 가정이 어느 정도 충족될 경우, 판별 분석은 로지스틱 회귀(logistic regression)를 포함한 다른 분류 기법보다 더 강력한 도구로 작동합니다.실제로 데이터가 다변량 정규분포를 따를 때 판별 분석

  6. 인스턴스 기반 표현(Instance-Based Representation)이란 무엇인가?

    학습의 가장 단순한 형태: 암기식 학습학습 구조 중 가장 단순한 것은 단순 암기, 즉 기계적 반복 학습(rote learning)입니다. 훈련 데이터로 주어진 사례들을 그대로 기억해 두었다가, 새로운 사례가 등장하면 기억된 훈련 사례들 가운데 가장 유사한 것을 찾아내는 방식입니다.여기서 핵심 문제는 유사하다는 것을 어떻게 정의하느냐입니다. 이는 인스턴스 집합에서 추출한 지식을 표현하는 완전히 다른 방법으로, 규칙을 만들려 하지 않고 사례 자체를 저장합니다. 즉, 클래스가 이미 알려져 있는 기존 사례들과 클래스가 아직 알려지지 않은

  7. 의사결정 트리(Decision Tree)를 구성하는 방법은 무엇일까?

    의사결정 트리(decision tree)는 흐름도(flow-chart)와 유사한 형태의 트리 구조입니다. 각 내부 노드(internal node)는 특정 속성에 대한 검사(test)를 나타내고, 각 가지(branch)는 그 검사의 결과를 정의하며, 잎 노드(leaf node)는 최종 클래스 또는 클래스 분포를 설명합니다. 트리에서 가장 상위에 위치한 노드를 루트 노드(root node)라고 합니다.의사결정 트리의 재귀적 구성 절차의사결정 트리를 구성하는 문제는 재귀적으로 정의할 수 있습니다. 먼저 루트 노드에 배치할 속성을 하나 선

  8. 데이터 마이닝의 오차 추정 방법 총정리: 교차 검증부터 부트스트랩까지

    10겹 교차 검증(Tenfold Cross-Validation)은 특정 데이터셋에서 학습 방식의 오류율을 측정하는 가장 표준적인 방법입니다. 더욱 신뢰할 수 있는 결과를 얻으려면 이 10겹 교차 검증을 10회 반복해 평균을 내는 것이 좋습니다. 이 외에도 널리 활용되는 추정 방법으로는 LOOCV(Leave-One-Out 교차 검증)와 부트스트랩(Bootstrap)이 있습니다.LOOCV(Leave-One-Out 교차 검증)LOOCV는 사실상 n겹 교차 검증(n-fold cross-validation)의 극단적인 형태입니다. 여기서 n

  9. 방사형 기저 함수(RBF) 네트워크란 무엇인가? 구조와 학습 원리 완벽 정리

    방사형 기저 함수(RBF) 네트워크의 개요방사형 기저 함수(Radial Basis Function, RBF) 네트워크는 널리 사용되는 피드포워드(feed-forward) 신경망의 한 유형입니다. 입력층을 제외하면 두 개의 층으로 구성되며, 은닉 유닛이 계산을 수행하는 방식에서 다층 퍼셉트론(multilayer perceptron)과 차별화됩니다.은닉 유닛의 작동 원리각 은닉 유닛은 입력 공간상의 특정 지점을 정의하며, 주어진 인스턴스에 대한 출력(활성화 값)은 해당 지점과 인스턴스 사이의 거리에 따라 결정됩니다. 두 점이 가까울수록

  10. 일반화 사례(Generalized Exemplars)란? 초직사각형 개념과 작동 원리

    일반화 사례(Generalized Exemplars)의 기본 개념일반화 사례(generalized exemplars)는 인스턴스 공간(instance space) 내에서 직사각형 형태로 표현되는 영역을 의미합니다. 고차원 데이터를 다룰 때는 차원이 확장된 직사각형, 즉 초직사각형(hyperrectangle)이 되기 때문에 이러한 이름으로 불립니다. 새로운 인스턴스를 분류하려면 기존의 거리 함수를 일반화해야만 인스턴스와 초직사각형 사이의 거리를 계산할 수 있습니다.새로운 사례의 일반화 과정새로운 사례가 올바르게 분류되면, 같은 클래스

  11. 비지도 이산화(Unsupervised Discretization)란? 핵심 접근 방식 총정리

    속성(attribute)이 이산적(discrete)이라는 것은 해당 속성이 가질 수 있는 값의 수가 상대적으로 적고 유한하다는 의미입니다. 반면 연속적(continuous) 속성은 가질 수 있는 값의 수가 매우 많거나 무한하다고 간주됩니다.다르게 표현하면, 이산형 데이터 속성은 치역(range)이 유한한 집합인 함수로 볼 수 있으며, 연속형 데이터 속성은 치역이 무한하고 완전히 순서화된 집합, 즉 일반적으로 하나의 구간(interval)인 함수로 볼 수 있습니다.이산화(Discretization)의 목적이산화는 연속 속성이 가질 수

  12. 데이터 웨어하우스 데스크톱 환경 구축 시 반드시 고려해야 할 핵심 과제

    데스크톱 머신의 사양은 사용자의 특성과 필요로 하는 도구의 요구 사항에 따라 결정됩니다. 웹 브라우저를 통해 HTML 문서 형태로 필요한 데이터를 확인하는 일반 사용자라면, 인터넷 브라우저를 실행할 수 있는 수준의 성능만 있으면 충분합니다.반면, 복잡한 쿼리와 분석을 처음부터 직접 개발하는 파워 유저(power user)는 훨씬 더 강력한 성능의 머신이 필요할 수 있습니다. 이처럼 데스크톱 환경을 구성할 때는 다음과 같은 과제들을 신중하게 검토해야 합니다.1. 크로스 플랫폼 지원일부 조직에서는 마케팅 부서에 매킨토시(Macintos

  13. 디렉토리 서버란 무엇인가? 개념부터 핵심 특징까지 한눈에

    디렉토리 서버(Directory Server)는 네트워크상에서 접근 가능한 다양한 자원들을 중앙에서 관리하는 일종의 데이터 저장소입니다. 여기서 다루는 자원에는 데이터베이스 장치, 개별 데이터베이스, 파일 저장소, 트랜잭션 시스템, 파일 스토리지 영역, 프린터, 그리고 사람까지 폭넓게 포함됩니다.디렉토리 서버의 역할사람에 대한 정보에는 이름과 주소, 조직 내 역할, 이메일 주소 등이 포함됩니다. 디렉토리 서버는 이러한 정보 중 선택된 항목만을 적법하게 인증된 요청자에게 공개하며, 연결된 네트워크에서 누구와 어떻게 소통할지 파악할 수

  14. 대칭 키 암호화란? 개념부터 활용 사례까지 총정리

    대칭 키 암호화(symmetric key encryption)는 가장 단순한 형태의 암호화 방식입니다. 개인 키 암호화(private key encryption)라고도 부르며, 하나의 비밀 키로 정보를 잠그고(lock) 여는(unlock) 작업을 모두 수행할 수 있다는 것이 가장 큰 특징입니다.대칭 키 암호화의 두 가지 핵심 활용 분야대칭 키 암호화는 주로 다음 두 가지 상황에서 그 진가를 발휘합니다.1. 데이터의 개인 암호화사용자가 자신만 보관하는 개인 키(비공개 키)로 데이터를 암호화하는 방식입니다. 키를 아무에게도 알려주지 않

  15. 공개 키 암호화(Public-Key Encryption)란? 개념과 작동 원리 총정리

    공개 키 암호화의 탄생 배경대칭 키 암호화(Symmetric Key Encryption)는 가장 큰 문제점을 안고 있습니다. 바로 키를 어떻게 안전하게 배포하느냐는 것입니다. 서로 떨어져 있는 두 당사자가 인터넷과 같은 개방된 환경에서도 안전한 연결을 설정할 수 있도록 하기 위해, 여러 가지 암호화 방식이 개발되었습니다. 이러한 암호화 방식을 바로 공개 키 암호화(Public-Key Encryption)라고 부릅니다.공개 키 암호화에서는 두 개의 키가 사용됩니다. 하나의 키로 정보를 암호화하고, 다른 키로 그 정보를 복호화하는 구조

  16. 데이터 웨어하우스란? 개념과 보안 환경을 위한 6가지 핵심 요소

    데이터 웨어하우징(Data Warehousing)은 다양한 소스에서 데이터를 수집하고 관리하여 기업에 의미 있는 비즈니스 인사이트를 제공하는 기술입니다. 데이터 웨어하우스는 특히 경영진의 의사결정을 지원하도록 설계되었습니다.데이터 웨어하우스의 정의와 역할쉽게 말해, 데이터 웨어하우스는 조직의 운영(OLTP) 데이터베이스와 독립적으로 유지·관리되는 데이터베이스를 의미합니다. 데이터 웨어하우스 시스템은 여러 애플리케이션 시스템을 통합할 수 있도록 지원하며, 통합된 과거 데이터를 기반으로 분석을 수행할 수 있는 강력한 플랫폼을 제공함으로

  17. 팩트 테이블 처리란 무엇인가? 데이터 웨어하우스의 핵심 개념 완벽 정리

    팩트 테이블이란 무엇인가?팩트 테이블(Fact Table)은 복합 기본키(Composite Primary Key)를 사용하는 것이 특징입니다. 이 복합 키는 여러 개의 외래키(Foreign Key)로 구성되며, 각 외래키는 팩트 테이블이 참조하는 차원 테이블(Dimension Table)마다 하나씩 존재합니다. 또한 이러한 차원들을 활용해 측정값(Measure)을 담는 컬럼들도 함께 포함됩니다.데이터 스테이징 과정에서의 서러게이트 키 변환모든 데이터 스테이징(Data Staging) 프로세스에는 반드시 하나의 단계가 포함되어야 합니

  18. 데이터 마이닝 변환이란? 핵심 개념과 4가지 주요 변환 기법

    데이터 마이닝(Data Mining)은 저장소에 축적된 대량의 데이터 속에서 통계학 및 수학적 기법을 포함한 패턴 인식 기술을 활용해 유용한 상관관계, 패턴, 추세를 발견하는 과정입니다. 즉, 사실(fact) 데이터셋을 분석하여 예상치 못한 관계를 찾아내고, 데이터 소유자에게 논리적이면서도 실질적으로 도움이 되는 새로운 방식으로 기록을 요약하는 작업이라 할 수 있습니다.데이터 마이닝의 주요 변환 기법데이터 마이닝에서 활용되는 대표적인 변환 기법은 다음과 같습니다.1. 정상·비정상·범위 이탈·불가능한 사실에 플래그 지정측정된 사실에

  19. 데이터 마이닝의 핵심 개념 총정리: 분류부터 예측, 연관 규칙까지

    데이터 마이닝이란 무엇인가?데이터 마이닝(Data Mining)은 저장소에 대량으로 축적된 데이터 속에서 통계학 및 수학 기법을 포함한 패턴 인식 기술을 활용하여, 유용한 새로운 상관관계·패턴·트렌드를 발견하는 과정입니다. 즉, 사실에 기반한 데이터셋을 분석해 예상치 못한 관계를 찾아내고, 데이터 소유자에게 논리적으로도 실용적으로도 가치 있는 방식으로 기록을 요약·정리하는 작업이라 할 수 있습니다.데이터 마이닝에는 여러 가지 핵심 개념이 있으며, 대표적인 것들은 다음과 같습니다.1. 분류(Classification)분류는 데이터 클

  20. 데이터 시각화란? 주요 용도와 활용 방법 완벽 정리

    데이터 시각화의 개념데이터 시각화(Data Visualization)는 차트, 그래프, 이미지, 목록 등 다양한 시각적 요소를 활용하여 데이터를 표현하는 기술입니다. 이를 통해 사용자는 짧은 시간 안에 데이터를 파악하고, 유용한 정보와 패턴, 추세를 손쉽게 도출할 수 있습니다. 복잡한 데이터도 한눈에 이해하기 쉽게 만들어 주는 것이 가장 큰 장점입니다.쉽게 말해, 데이터를 그래픽 형태로 표현하여 사용자가 데이터 속 추세와 흐름을 직관적으로 이해할 수 있도록 돕는 것이 바로 데이터 시각화입니다.데이터 시각화 도구데이터 시각화에는 차트

Total 1478 -컴퓨터  FirstPage PreviousPage NextPage LastPage CurrentPage:47/74  20-컴퓨터/Page Goto:1 41 42 43 44 45 46 47 48 49 50 51 52 53