Length Bitmap HASH Based POS Tagging System

길이 비트맵 해시 기반 형태소 분석 시스템

  • Seon Choong-Nyoung (Diquest Inc., Department of Computer Science, Sogang University) ;
  • Min Kyungkoo (Diquest Inc., Department of Computer Science, Sogang University) ;
  • Seo Jungyun (Diquest Inc., Department of Computer Science, Sogang University)
  • Published : 2005.07.01

Abstract

인터넷의 확장에 따라 형태소 분석기에서 사용하는 사전의 규모도 커지고 있다. 이러한 상황은 사전의 증가를 가져옴으로써 기존 형태소 분석기의 자료 구조에 대한 새로운 요구를 발생시켰다. 기존의 트라이를 이용한 방법은 노드의 과다 생성과 데이터 부족문제로 발생하는 메모리 낭비의 문제를 가지고 있다. 효율적인 메모리 사용을 위해서는 해시 구조가 적절하다. 하지만 이 경우 트라이에 비해 검색 횟수의 복잡도가 비약적으로 증가되는 문제점을 안고 있다. 본 논문에서는 해시를 위한 길이 비트맵을 이용하여 검색 횟수를 제한할 수 있는 방법을 제안하였다. 실험을 통해 제안된 자료 구조와 해시와 트라이의 형태소 사전 검색 횟수를 비교하였으며 비문 사용이 많은 영역에서 효율적임을 입증하였다.

Keywords