세종 구문분석 말뭉치의 구축과 통사 범주 및 기능의 통계적 분포

Sejong Korean Treebank : Methods of Construction and Distribution of Syntactic Categories and Functions
  • 홍정하
  • 김주영
  • 강범모

초록

세종 구문분석 말뭉치는 지금까지 구축된 한국어 구문분석 말뭉치(코퍼스) 중 가장 큰 규모이이며, 말뭉치 구성을 위한 텍스트 선별에서 장르별 균형성 및 문장의 복잡도까지 고려되어 구축되었다. 따라서 세종 구문분석 말뭉치는 한국어의 구문적 특성을 포착할 수 있는 대표성을 갖춘 언어자료라 할 수 있으며, 학문 연구자에게는 공개되는 만큼 그 의의와 활용 가능성은 매우 높다고 할 수 있다. 그러나 언어학적으로 세종 구문분석 말뭉치의 높은 활용 가치에도 불구하고, 그동안 이에 대한 분포적 연구가 세종 원시 말뭉치 및 형태분석 말뭉치에 비해 활발하게 진행되지는 못하였다. 더구나 이를 활용한 일부의 연구에서 세종 구문분석 말뭉치의 분석 원리 및 지침에 대한 오해로 인해 잘못된 통계 수치를 제공하기도 하였다. 이 논문은 세종 구문분석 말뭉치의 올바른 활용은 구축 방법론에 대한 정확한 이해에서 찾을 수 있다고 보고, 세종 구문분석 말뭉치의 구축 방법론을 소개하고 그 한계를 논의한 후, 전체 구문분석 말뭉치에 나타나는 한국어 구문의 개괄적인 분포 특성을 제시한다.

키워드

21세기 세종계획구문분석 말뭉치코퍼스구문분석구문분석 표지구문 분포21st Century Sejong ProjectSejong corporaTreebankCorporaSyntactic parsingSyntactic annotationSyntactic distribution
제목
세종 구문분석 말뭉치의 구축과 통사 범주 및 기능의 통계적 분포
제목 (타언어)
Sejong Korean Treebank : Methods of Construction and Distribution of Syntactic Categories and Functions
저자
홍정하김주영강범모
발행일
2008
저널명
민족문화연구
49
페이지
285 ~ 331