Korean BaseNP Identification using the variation of context length and position

문맥 윈도우의 크기와 위치 변화를 이용한 한국어 기반 명사구 인식

  • 전수영 (한국과학기술 전산학과) ;
  • 강인호 (한국과학기술 전산학과) ;
  • 김길창 (한국과학기술 전산학과)
  • Published : 2002.04.01

Abstract

한국어의 비재귀 명사구 즉 기반 명사구(basehp)를 인식하는 알고리즘을 제시한다. 본 논문에서는 한개의 주어진 학습 알고리즘에 대해 문맥 윈도우의 크기와 문맥 윈도우의 위치를 달리해 가면서 학습시킨다 이러한 방법을 통해 서로 다른 정보를 바탕으로 한 기반 명사구 인식을 수행할 수 있으며, 그 결과서로 다른 여러 개의 결과들을 생성할 수 있다. 본 논문에에서는 이렇게 얻어진 여러 개의 인식 결과들을 적절한 방법으로 결합하여 한국어에서 91% 이상의 높은 기반명사구 인식 정확도를 얻어낼 수 있다. 15만 단어 규모의 국어정보베이스의 말뭉치를 사용했으며 , 학습 알고리즘으로는 메모리 기반 학습 알고리즘 (memory-based learning)을 이용하여 실험하였다.

Keywords