DOI QR코드

DOI QR Code

An effective method for comparing similarity of document with Multi-Level alignment

다단계정렬을 활용한 효율적인 문서 유사도 비교법

  • Seo, Jong-Kyu (Dept. of Computer Engineering, Pusan National University) ;
  • Hwang, Hae-Lyen (Dept. of Computer Engineering, Pusan National University) ;
  • Cho, Hwan-Gue (Dept. of Computer Engineering, Pusan National University)
  • 서종규 (부산대학교 컴퓨터공학과) ;
  • 황혜련 (부산대학교 컴퓨터공학과) ;
  • 조환규 (부산대학교 컴퓨터공학과)
  • Published : 2012.04.26

Abstract

문서와 문서간의 유사도들 측정하는 방법 은 크게 지문법 (fingerprint)을 이용한 방법과 서열 정렬(sequence alignment)알고리즘을 이용한 방법이 있다. 두 방법은 각각 속도와 정확도라는 장점을 가지고 있다. 다단계정렬(MLA, Multi-Level alignment))는 이러한 두 방법을 조합하여 탐색 속도와 정확도 사이의 비중을 사용자가 결정할 수 있도록 하기 위한 방법이다.[1] 다단계 정렬은 두 문서를 단위 블록(basis block)로 나누고 블록 간의 벡터를 비교하여 유사도를 측정하게 되는데, 본 연구에서는 초성 추출 및 어간 추출을 통해 단위 블록의 벡터를 빠른 시 간에 생성하고 비교하는 방법과 다단계 탐색을 통해 정확도를 유지하면서 빠르게 유사도를 측정하는 방식에 대해 설명한다. 실험결과 제안 방법을 통해 다단계 정렬 방법을 이용한 대용량 문서 비교의 속도가 2 배 이상 빨라짐을 보인다.

Keywords

Acknowledgement

Supported by : 한국연구재단