Computer >> 컴퓨터 >  >> 프로그래밍 >> C 프로그래밍

C 언어로 문자열 내 각 문자의 빈도수 세는 프로그램 작성하기

문자열을 처리하다 보면 각 문자가 몇 번 등장했는지 세어야 하는 경우가 자주 있습니다. 이번 글에서는 C 언어로 문자열 내 각 알파벳 문자의 빈도수를 계산하는 프로그램을 작성하는 방법을 알고리즘부터 실행 결과까지 차근차근 살펴보겠습니다.

알고리즘

다음 단계를 따르면 각 문자의 빈도를 세는 C 프로그램을 손쉽게 작성할 수 있습니다.

1단계: MAX 크기를 정의한다.
2단계: char형 변수와 int형 변수를 선언한다.
3단계: 콘솔에서 문자열을 입력받는다.
4단계: 문자열의 길이를 구한다.
5단계: 각 문자의 빈도를 0으로 초기화한다.
6단계: 각 문자가 나타난 총 횟수를 구한다.
for(i=0; i<length; i++)
    i. if(string[i]>='a' && string[i]<='z')
           frequency[string[i] - 97]++;
    ii. else if(string[i]>='A' && string[i]<='Z')
           frequency[string[i] - 65]++;
7단계: 문자열에 포함된 모든 문자의 빈도를 출력한다.
if(frequency[i] != 0)
    printf("'%c' = %d\n", (i + 97), frequency[i]);

전체 예제 코드

다음은 문자열을 입력받아 각 문자의 빈도를 계산한 뒤 결과를 출력하는 완전한 C 프로그램입니다.

#include <stdio.h>
#include <string.h>
#define MAX 100 // 최대 문자열 크기

int main(){
    char string[MAX];
    int i, length;
    int frequency[26]; // 알파벳 개수(26)만큼 배열 선언

    /* 사용자로부터 문자열 입력 */
    printf("enter the string:\n ");
    gets(string);
    length = strlen(string);

    /* 각 문자의 빈도를 0으로 초기화 */
    for(i=0; i<26; i++){
        frequency[i] = 0;
    }

    /* 각 문자가 나타난 총 횟수 계산 */
    for(i=0; i<length; i++){
        /* 현재 문자가 영문 소문자인 경우 */
        if(string[i]>='a' && string[i]<='z'){
            frequency[string[i] - 97]++;
        }
        /* 현재 문자가 영문 대문자인 경우 */
        else if(string[i]>='A' && string[i]<='Z'){
            frequency[string[i] - 65]++;
        }
    }

    /* 문자열 내 모든 문자의 빈도 출력 */
    printf("\nFrequency of all characters in string: \n");
    for(i=0; i<26; i++){
        /* 해당 문자가 문자열에 실제로 존재하는 경우에만 출력 */
        if(frequency[i] != 0){
            printf("'%c' = %d\n", (i + 97), frequency[i]);
        }
    }
    return 0;
}

코드의 핵심 원리: 아스키 코드 활용

이 프로그램의 핵심은 아스키(ASCII) 코드 값을 활용하는 것입니다. 영문 소문자 'a'의 아스키 코드 값은 97이므로, 임의의 소문자에서 97을 빼면 0~25 사이의 인덱스를 얻을 수 있습니다. 마찬가지로 대문자 'A'의 아스키 값은 65이므로, 대문자에서 65를 빼면 동일한 방식으로 인덱스를 구할 수 있습니다. 이렇게 구한 인덱스를 배열 첨자로 사용해 해당 문자의 등장 횟수를 1씩 증가시키는 것입니다.

대문자와 소문자는 같은 위치의 인덱스로 매핑되기 때문에(예: 'T'와 't'는 모두 인덱스 19), 이 프로그램은 대소문자를 구분하지 않고 같은 글자로 취급해 빈도를 누적합니다. 반면 공백, 숫자, 특수문자 등 알파벳이 아닌 문자는 조건문에서 걸러지므로 집계 대상에서 제외됩니다.

참고로 원본 예제에서는 빈도 배열의 크기가 20으로 선언되어 있었지만, 알파벳은 총 26개이므로 'u' 이후의 문자를 처리할 때 배열 범위를 벗어나는 문제가 발생할 수 있습니다. 위 코드에서는 이를 26으로 수정해 안전하게 동작하도록 했습니다. 또한 gets() 함수는 버퍼 오버플로 위험 때문에 C11 표준에서 제거되었으므로, 실제 개발 환경에서는 fgets(string, MAX, stdin)과 같은 안전한 입력 함수를 사용하는 것이 좋습니다.

실행 결과

위 프로그램을 컴파일해 실행한 뒤 "Tutorials Point"를 입력하면 다음과 같은 결과가 출력됩니다.

enter the string:
Tutorials Point
Frequency of all characters in string:
'a' = 1
'i' = 2
'l' = 1
'n' = 1
'o' = 2
'p' = 1
'r' = 1
's' = 1
't' = 3

결과에서 't'가 3회로 가장 많이 등장한 것을 확인할 수 있습니다. 이는 대문자 'T'와 소문자 't'가 하나의 카운터에 함께 누적되었기 때문입니다.