상세 보기
초록
세종 구문분석 말뭉치는 지금까지 구축된 한국어 구문분석 말뭉치(코퍼스) 중 가장 큰 규모이이며, 말뭉치 구성을 위한 텍스트 선별에서 장르별 균형성 및 문장의 복잡도까지 고려되어 구축되었다. 따라서 세종 구문분석 말뭉치는 한국어의 구문적 특성을 포착할 수 있는 대표성을 갖춘 언어자료라 할 수 있으며, 학문 연구자에게는 공개되는 만큼 그 의의와 활용 가능성은 매우 높다고 할 수 있다. 그러나 언어학적으로 세종 구문분석 말뭉치의 높은 활용 가치에도 불구하고, 그동안 이에 대한 분포적 연구가 세종 원시 말뭉치 및 형태분석 말뭉치에 비해 활발하게 진행되지는 못하였다. 더구나 이를 활용한 일부의 연구에서 세종 구문분석 말뭉치의 분석 원리 및 지침에 대한 오해로 인해 잘못된 통계 수치를 제공하기도 하였다. 이 논문은 세종 구문분석 말뭉치의 올바른 활용은 구축 방법론에 대한 정확한 이해에서 찾을 수 있다고 보고, 세종 구문분석 말뭉치의 구축 방법론을 소개하고 그 한계를 논의한 후, 전체 구문분석 말뭉치에 나타나는 한국어 구문의 개괄적인 분포 특성을 제시한다.
키워드
21세기 세종계획; 구문분석 말뭉치; 코퍼스; 구문분석; 구문분석 표지; 구문 분포; 21st Century Sejong Project; Sejong corpora; Treebank; Corpora; Syntactic parsing; Syntactic annotation; Syntactic distribution
- 제목
- 세종 구문분석 말뭉치의 구축과 통사 범주 및 기능의 통계적 분포
- 제목 (타언어)
- Sejong Korean Treebank : Methods of Construction and Distribution of Syntactic Categories and Functions
- 저자
- 홍정하; 김주영; 강범모
- 발행일
- 2008
- 저널명
- 민족문화연구
- 호
- 49
- 페이지
- 285 ~ 331