상세 보기
일본 IT정책 텍스트 분석을 위한 텍스트 전처리 및 임베딩에 관한 연구
A Study on Text Preprocessing and Embedding for the Text analysis of Japan’s IT Policy
- 김민호;
- 최상옥
초록
본 논문은 자연어로 작성된 일본 IT전략을 분석데이터로 변환하고 텍스트 네트워크로 구축하는 방법을 연구하며, 일본 IT정책 텍스트 분석에 적합한 텍스트 전처리 방법과 단어 임베딩 알고리즘 탐색을 목적으로 한다. 본 연구는 텍스트 전처리 방법과 임베딩 알고리즘을 평가하기 위해 다중분류 성능평가를 실시하였다. 실험결과, 일본 IT정책 텍스트의 특징으로 인해, 형태소분석, 불용어제거, 단어 인코딩을 수행하지 않은 경우, 다중분류 평가지표가 낮게 나타났다. 또한, Skip-gram 알고리즘이 CBOW 알고리즘에 비해 상대적으로 높은 성능을 보였다. 형태소분석, 불용어제거, 단어 인코딩 등이 제대로 수행되지 않는다면 중심단어가 주변단어와 적절하게 상호작용되지 않고 모델이 부적절 하게 학습된다고 볼 수 있다. 실험결과를 종합하면, 일본어로 작성된 IT정책 텍스트를 대상으로 텍스트 분석을 하는 경우에는 텍스트의 언어적 특성과 일본식 한자와 히라가나⋅가타카나가 혼합된 문장(Kanji-Kana mixed sentence)으로 구성된 점 등을 고려하여 적절한 텍스트 전처리 방법과 임베딩 알고리즘을 선택하고 활용해야 함을 알 수 있다.
키워드
일본 IT전략; 자연어처리; 텍스트 전처리; 단어 임베딩; 분류평가지표; Japan’s IT strategy; Natural Language Processing; Text Preprocessing; Word Embedding; Classification Evaluation Metrics
- 제목
- 일본 IT정책 텍스트 분석을 위한 텍스트 전처리 및 임베딩에 관한 연구
- 제목 (타언어)
- A Study on Text Preprocessing and Embedding for the Text analysis of Japan’s IT Policy
- 저자
- 김민호; 최상옥
- 발행일
- 2024-03
- 저널명
- 정보통신정책연구
- 권
- 31
- 호
- 1
- 페이지
- 53 ~ 74