KBLiMP: 언어모델은 한국어 통사 현상을 얼마나 이해하는가?

KBLiMP: How Well Do Language Models Understand. Korean Syntactic Phenomena?
  • 송상헌
  • 노강산
  • 박은아
  • 이수빈
  • 이예빈
  • 외 1명

초록

본고는 한국어 특화 언어모델의 통사적 평가를 위한 벤치마크 KBLiMP(Korean Benchmark of Minimal Pair)를 선보인다. 한국어 언어모델의 언어능력 평가에서 다양한 층위의 다양한 방법론이 그동안 도입되었나, 정작 현대 언어학의 근간이라고 할 수 있는 통사론에 방점을 둔 평가 체계는 소략한 실정이다. 언어모델 평가의 기본은 언어모델이 특정 언어의 현상을 그 모국어 화자와 같이 이해하고 처리할 수 있는가를 측정하는 것이다. 따라서 매개 언어의 분포를 중점으로 현상을 설명하는 통사론은 언어모델 평가에도 가장 기초 단계에 자리매김하고 있어야 한다. 그렇지 않다면, 이른바 평가체계는 사상누각에 지나지 않을 수 있다. 이러한 관점에서 본고는 언어모델의 한국어 통사 이해 능력을 평가하기 위한 기본 방편과 데이터세트를 제공한다. 한국어에서 특징적으로 관찰되는 여덟 가지 언어 현상을 선정하고, 각 현상을 구성하는 인자를 2×2 구조로 구성하였다. 이러한 구획에 따라 현상별 400개의 최소 대립쌍을 구축하여 언어모델의 이해도를 평가하였다. 6개의 인코더 모델과 2개의 디코더 모델을 사용한 실험 결과 전체 언어 현상을 완벽히 이해한 모델은 없었다. 이는 현재 한국어 통사 현상을 완벽히 이해하는 언어모델이 부재함을 시사한다. 본 연구에서 구축된 데이터세트는 한국어 특화 모델의 개발 및 평가에 이바지하고자 공개된다.

키워드

언어모델언어 현상평가통사론한국어language modellinguistic phenomenaevaluationsyntaxKorean
제목
KBLiMP: 언어모델은 한국어 통사 현상을 얼마나 이해하는가?
제목 (타언어)
KBLiMP: How Well Do Language Models Understand. Korean Syntactic Phenomena?
저자
송상헌노강산박은아이수빈이예빈조은비
DOI
10.20988/lfp.2025.64..265
발행일
2025-02
저널명
언어사실과 관점
64
페이지
265 ~ 324