• 제목/요약/키워드: 희소주성분분석

검색결과 5건 처리시간 0.024초

희소주성분분석을 이용한 텍스트데이터의 단어선택 (Feature selection for text data via sparse principal component analysis)

  • 손원
    • 응용통계연구
    • /
    • 제36권6호
    • /
    • pp.501-514
    • /
    • 2023
  • 텍스트데이터는 일반적으로 많은 단어로 이루어져 있다. 텍스트데이터와 같이 많은 변수로 구성된 데이터의 경우 과적합 등의 문제로 분석에 있어서의 정확성이 떨어지고, 계산과정에서의 효율성에도 문제가 발생하는 경우를 흔히 볼 수 있다. 이렇게 변수가 많은 데이터를 분석하기 위해 특징선택, 특징추출 등의 차원 축소 기법이 자주 사용되고 있다. 희소주성분분석은 벌점이 부여된 최소제곱법 중 하나로 엘라스틱넷 형태의 목적함수를 사용하여 유용하지 않은 주성분을 제거하고 각 주성분에서도 중요도가 큰 변수만 식별해내기 위해 활용되고 있다. 이 연구에서는 희소주성분분석을 이용하여 많은 변수를 가진 텍스트데이터를 소수의 변수만으로 요약하는 절차를 제안한다. 이러한 절차를 실제 데이터에 적용한 결과, 희소주성분분석을 이용하여 단어를 선택하는 과정을 통해 목표변수에 대한 정보를 이용하지 않고도 유용성이 낮은 단어를 제거하여 텍스트데이터의 분류 정확성은 유지하면서 데이터의 차원을 축소할 수 있음을 확인하였다. 특히 차원축소를 통해 고차원 데이터 분석에서 분류 정확도가 저하되는 KNN 분류기 등의 분류 성능을 개선할 수 있음을 알 수 있었다.

MCMC 결측치 대체와 주성분 산점도 기반의 SOM을 이용한 희소한 웹 데이터 분석 (Sparse Web Data Analysis Using MCMC Missing Value Imputation and PCA Plot-based SOM)

  • 전성해;오경환
    • 정보처리학회논문지D
    • /
    • 제10D권2호
    • /
    • pp.277-282
    • /
    • 2003
  • 웹으로부터 유용한 정보를 얻기 위한 연구는 현재 많이 진행되고 있다. 본 논문에서는 특히 웹 로그 데이터의 희소성에 대한 문제 해결과 이를 통한 웹 사용자의 군집화 방안에 대하여 연구하였다. MCMC 방법의 베이지안 추론에 의한 결측치 대체 기법을 이용하여 웹 데이터의 희소성을 제거하였고, 주성분에 의한 산점도를 통하여 형상지도의 차원을 결정한 자기 조직화지도를 이용하여 웹 사용자의 군집화를 수행하였다. 제안 기법은 기존의 방법들에 비해 모형의 정확도와 빠른 학습 시간을 제공하여 주었다. KDD Cup 데이터를 이용한 실험을 통하여 제안 방법에 대한 문제 해결 절차 및 성능 평가를 객관적으로 확인하였다.

소셜 데이터의 주된 감성분석에 대한 연구 (Study on Principal Sentiment Analysis of Social Data)

  • 장필식
    • 한국컴퓨터정보학회논문지
    • /
    • 제19권12호
    • /
    • pp.49-56
    • /
    • 2014
  • 본 논문에서는 대용량의 문서, 인터넷 댓글, 소셜 데이터, 메시지 텍스트 등으로부터 표준, 일상적 언어, 및 은어(隱語), 비속어, 약어, 이모티콘 등을 감성 분석함으로써, 복합적인 감성 중 근간이 되는 주 감성들을 측정하고 평가하는 방법을 제안한다. 제안된 방법론은 IRLBA(Implicitly Restarted Lanczos Bidiagonalization Algorithm)을 활용하여 규모가 큰 희소행렬에 대한 주성분분석을 실시하며, 데이터 취합, 메시지 분석, 감성 평가, 감성 분석 및 통합 그리고 결과물 시각화 모듈로 구성된다. 본 연구를 통해 제안된 방법론은 소셜 데이터의 감성분석의 정확도를 향상시키고 감성분석의 활용범위를 확장시키는데 있어 도움을 줄 수 있을 것으로 기대된다.

하상구조에 따른 4개 하천의 어류 분포 특성 비교 (Comparison of Fish Distribution Characteristics by Substrate Structure in the 4 Streams)

  • 윤석진;최준길;이황구
    • 한국환경생태학회지
    • /
    • 제28권3호
    • /
    • pp.302-313
    • /
    • 2014
  • 모래형 하천과 자갈형 하천의 어류군집 특성을 비교하기 위해 4개의 하천을 선정하여 계절별 조사를 실시하였으며, 출현한 어종 중 한국고유종은 Acheilognathus gracilis 외 24종으로 확인되었다. 홍천강과 무주남대천의 우점종은 Zacco koreanus로 각각 39.9%, 28.4%를 차지하였으며, 양화천은 Rhodeus notatus가 13.6%, 갑천은 Z. platypus가 26.0%로 우점하였다. 군집분석 결과 우점도지수는 0.27~0.63, 다양도지수는 1.92~2.67, 균등도지수는 0.6~0.79, 풍부도지수는 3.09~3.53의 범위로 나타났으며, 우점도지수는 홍천강에서 가장 높고, 다양도, 균등도, 풍부도지수는 양화천에서 가장 높게 나타났다. 내성도 길드 분석 결과 하상구조물이 다양한 홍천강과 무주남대천은 민감종이 각각 50.1%와 46.4%로 비교적 높은 비율을 차지하였고, 모래 하상이 높은 양화천과 갑천은 민감종이 각각 0.5%와 5.3%의 희소한 비율을 차지하였다. 하천별 출현한 어류의 종별 개체수와 하상구조를 이용하여 유사도를 분석한 결과 자갈형 하천인 홍천강과 무주남대천이 종과 개체수는 50.4%, 하상구조는 95.2%로 가장 유사하였다. IBI 분석결과 홍천강과 무주남대천이 'A등급', 양화천과 갑천이 'B등급'으로 나타났고, 주성분 분석결과 자갈형 하천과 모래형 하천의 2개의 그룹으로 구분되었다.

유전 알고리즘 기반의 비정상 행위 탐지를 위한 특징선택 (Feature Selection for Anomaly Detection Based on Genetic Algorithm)

  • 서재현
    • 한국융합학회논문지
    • /
    • 제9권7호
    • /
    • pp.1-7
    • /
    • 2018
  • 데이터 전처리 기법 중 하나인 특징 선택은 대규모 데이터셋을 다루는 다양한 응용분야에서 주요 연구 분야 중 하나로 각광받고 있다. 특징 선택은 패턴 인식, 기계학습 및 데이터 마이닝에서 사용됐고, 최근에는 텍스트 분류, 이미지 검색, 침입 탐지 및 게놈 분석과 같은 다양한 분야에 널리 적용되고 있다. 제안 방법은 메타 휴리스틱 알고리즘 중의 하나인 유전 알고리즘을 기반으로 한다. 특징 부분 집합을 찾는 방법은 크게 필터(filter) 방법과 래퍼(wrapper) 방법이 있는데, 본 연구에서는 최적의 특징 부분 집합을 찾기 위해 실제 분류기를 사용한 평가를 하는 래퍼 방법을 사용한다. 실험에 사용한 훈련 데이터셋은 클래스 불균형이 심하여 희소클래스에 대한 분류 성능을 높이기 어렵다. SMOTE 기법을 적용한 훈련 데이터셋을 사용하여 특징 선택을 하고 다양한 기계학습 알고리즘을 사용하여 선택한 특징들의 성능을 평가한다.