DOI QR코드

DOI QR Code

희소주성분분석을 이용한 텍스트데이터의 단어선택

Feature selection for text data via sparse principal component analysis

  • 손원 (단국대학교 정보통계학과)
  • Won Son (Department of Information Statistics, Dankook University)
  • 투고 : 2023.02.24
  • 심사 : 2023.05.27
  • 발행 : 2023.12.31

초록

텍스트데이터는 일반적으로 많은 단어로 이루어져 있다. 텍스트데이터와 같이 많은 변수로 구성된 데이터의 경우 과적합 등의 문제로 분석에 있어서의 정확성이 떨어지고, 계산과정에서의 효율성에도 문제가 발생하는 경우를 흔히 볼 수 있다. 이렇게 변수가 많은 데이터를 분석하기 위해 특징선택, 특징추출 등의 차원 축소 기법이 자주 사용되고 있다. 희소주성분분석은 벌점이 부여된 최소제곱법 중 하나로 엘라스틱넷 형태의 목적함수를 사용하여 유용하지 않은 주성분을 제거하고 각 주성분에서도 중요도가 큰 변수만 식별해내기 위해 활용되고 있다. 이 연구에서는 희소주성분분석을 이용하여 많은 변수를 가진 텍스트데이터를 소수의 변수만으로 요약하는 절차를 제안한다. 이러한 절차를 실제 데이터에 적용한 결과, 희소주성분분석을 이용하여 단어를 선택하는 과정을 통해 목표변수에 대한 정보를 이용하지 않고도 유용성이 낮은 단어를 제거하여 텍스트데이터의 분류 정확성은 유지하면서 데이터의 차원을 축소할 수 있음을 확인하였다. 특히 차원축소를 통해 고차원 데이터 분석에서 분류 정확도가 저하되는 KNN 분류기 등의 분류 성능을 개선할 수 있음을 알 수 있었다.

When analyzing high dimensional data such as text data, if we input all the variables as explanatory variables, statistical learning procedures may suffer from over-fitting problems. Furthermore, computational efficiency can deteriorate with a large number of variables. Dimensionality reduction techniques such as feature selection or feature extraction are useful for dealing with these problems. The sparse principal component analysis (SPCA) is one of the regularized least squares methods which employs an elastic net-type objective function. The SPCA can be used to remove insignificant principal components and identify important variables from noisy observations. In this study, we propose a dimension reduction procedure for text data based on the SPCA. Applying the proposed procedure to real data, we find that the reduced feature set maintains sufficient information in text data while the size of the feature set is reduced by removing redundant variables. As a result, the proposed procedure can improve classification accuracy and computational efficiency, especially for some classifiers such as the k-nearest neighbors algorithm.

키워드

참고문헌

  1. Chang Y, Hwang H, and Son W (2020). Unstructured Data Analysis, KNOU Press, Seoul. 
  2. Chen J, Huang H, Tian S, and Qu Y (2009). Feature selection for text classification with Naive Bayes, Expert Systems with Applications, 36, 5432-5435.  https://doi.org/10.1016/j.eswa.2008.06.054
  3. Forman G (2003). An extensive empirical study of feature selection metrics for text classification, Journal of Machine Learning Research, 3, 1289-1305. 
  4. Jang W, Kim YE, and Son W (2022). Feature selection for text data via topic modeling, The Korean Journal of Applied Statistics, 35, 739-754.  https://doi.org/10.5351/KJAS.2022.35.6.739
  5. Jeong HY, Shin SM, and Choi YS (2019). Comparison of term weighting schemes for document classification, The Korean Journal of Applied Statistics, 32, 265-276.  https://doi.org/10.5351/KJAS.2019.32.2.265
  6. Jolliffe IT (2002). Principal Component Analysis (2nd ed), Springer, New York.
  7. Manning C and Schutze H (1999). Foundations of Statistical Natural Language Processing, MIT Press, Cambridge, Massachusetts. 
  8. Mladenic D and Grobelnik M (1999). Feature selection for unbalanced class distribution and naive bayes. In Proceedings of the 16th International Conference on Machine Learning (ICML), Bled, Slovenia, 258-267. 
  9. Yang Y and Pedersen JO (1997). A comparative study on feature selection in text categorization. In Proceedings of the 14th International Conference on Machine Learning (ICML), Nashville, TN, 412-420. 
  10. Zou H, Hastie T, and Tibshirani R (2006). Sparse principal component analysis, Journal of Computational and Graphical Statistics, 15, 265-286.  https://doi.org/10.1198/106186006X113430