유니코드 한자-한글 자동 변환 연구 및 구현

A Study and Implementation of Automatic Unicode Hanja to Hangul Conversion

초록

텍스트의 가독성과 검색의 용이성을 위해 한자를 한글로 변환하여 병기하는 것이 바람직하다. 본 논문은 유니코드 텍스트에서의 문자 정규화에 대해 논하고 한자-한글 변환을 위해 필요한 언어 정보로서 한자-한글 테이블과 한자어-한글 사전을 구축하였다. 한자 음가 사전으로부터 한자-한글 테이블을 정의하고 우리말샘 사전으로부터 추출한 약 48만 개의 어휘를 포함하는 한자어-한글 사전을 구축하였다. 최장일치 알고리즘에 기반하여 두음법칙 및 예외 규칙 등을 적용한 자동 한자-한글 변환 시스템을 구현하였다. 1970년~2019년까지의 동아일보 코퍼스를 대상으로 구현한 시스템과 문자 단위의 변환 방법의 결과를 비교하였다.

키워드

Hanja-Hangul conversion; Unicode; character normalization; phonetic value; Hanja word dictionary; initial law; maximum matching algorithm; 한자-한글 변환; 유니코드; 문자 정규화; 음가; 한자어 사전; 두음법칙; 최장일치 알고리즘
제목
유니코드 한자-한글 자동 변환 연구 및 구현
제목 (타언어)
A Study and Implementation of Automatic Unicode Hanja to Hangul Conversion
저자
이도길
발행일
2024-02
저널명
한성어문학
권
51
페이지
1 ~ 28