• 제목/요약/키워드: term weighting method

검색결과 66건 처리시간 0.033초

자동 문서분류에서의 정규화 용어빈도 가중치방법 (Normalized Term Frequency Weighting Method in Automatic Text Categorization)

  • 김수진;박혁로
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2003년도 컴퓨터소사이어티 추계학술대회논문집
    • /
    • pp.255-258
    • /
    • 2003
  • This paper defines Normalized Term Frequency Weighting method for automatic text categorization by using Box-Cox, and then it applies automatic text categorization. Box-Cox transformation is statistical transformation method which makes normalized data. This paper applies that and suggests new term frequency weighting method. Because Normalized Term Frequency is different from every term compared by existing term frequency weighting method, it is general method more than fixed weighting method such as log or root. Normalized term frequency weighting method's reasonability has been proved though experiments, used 8000 newspapers divided in 4 groups, which resulted high categorization correctness in all cases.

  • PDF

의사연관피드백과 용어 가중치에 의한 문서요약 (Document Summarization using Pseudo Relevance Feedback and Term Weighting)

  • 김철원;박선
    • 한국정보통신학회논문지
    • /
    • 제16권3호
    • /
    • pp.533-540
    • /
    • 2012
  • 본 논문은 의사연관피드백과 의미특징기반의 용어 가중치에 의한 문서요약 방법을 제안한다. 제안된 방법은 의사연관피드백을 이용하여 사용자의 간섭을 최소화 시키며, 의미특징으로부터 유도된 용어의 가중치는 문장집합의 내부 특징을 잘 나타나기 때문에 문서요약의 질을 향상할 수 있다. 또한 가중치가 부여된 의미특징과 확장된 질의를 이용하여서 사용자의 요구사항과 제안방법의 요약결과 사이의 의미적 차이를 감소시킨다. 실험결과 제안방법이 용어의 가중치를 부여하지 않은 방법에 비해서 좋은 성능을 보인다.

An Optimal Weighting Method in Supervised Learning of Linguistic Model for Text Classification

  • Mikawa, Kenta;Ishida, Takashi;Goto, Masayuki
    • Industrial Engineering and Management Systems
    • /
    • 제11권1호
    • /
    • pp.87-93
    • /
    • 2012
  • This paper discusses a new weighting method for text analyzing from the view point of supervised learning. The term frequency and inverse term frequency measure (tf-idf measure) is famous weighting method for information retrieval, and this method can be used for text analyzing either. However, it is an experimental weighting method for information retrieval whose effectiveness is not clarified from the theoretical viewpoints. Therefore, other effective weighting measure may be obtained for document classification problems. In this study, we propose the optimal weighting method for document classification problems from the view point of supervised learning. The proposed measure is more suitable for the text classification problem as used training data than the tf-idf measure. The effectiveness of our proposal is clarified by simulation experiments for the text classification problems of newspaper article and the customer review which is posted on the web site.

용어 가중치에 의한 문서요약 (Document Summarization using Term Weighting)

  • 박선;김철원
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2012년도 추계학술대회
    • /
    • pp.704-706
    • /
    • 2012
  • 본 논문은 용어 가중치에 의한 문서요약 방법을 제안한다. 제안된 방법은 의사연관피드백을 이용하여 사용자의 간섭을 최소화 시키며, 의미특징으로부터 유도된 용어의 가중치는 문장집합의 내부 특징을 잘 나타나기 때문에 문서요약의 질을 향상할 수 있다.

  • PDF

의미특징 기반의 용어 가중치 재산정을 이용한 문서군집의 성능 향상 (Enhancing Document Clustering Using Term Re-weighting Based on Semantic Features)

  • 박선;김경준;김경호;이성로
    • 한국정보통신학회논문지
    • /
    • 제17권2호
    • /
    • pp.347-354
    • /
    • 2013
  • 본 논문은 확장된 용어를 기반으로 용어의 가중치를 재산정하여 문서군집의 성능을 향상시키는 방법을 제안한다. 제안된 방법은 의미특징을 이용하여 군집문서의 중요 용어를 추출하고, 워드넷을 이용하여 용어를 확장함으로서 문서의 주제를 잘 나타낼 수 있다. 또한 확장된 용어를 기반으로 하여 용어의 가중치를 재산정함으로써 문서군집의 성능을 높일 수 있다. 실험결과 제안방법을 적용한 문서군집방법이 적용하지 않은 문서군집 방법에 비해서 좋은 성능을 보인다.

클라우드 기반의 가중치에 의한 문서요약 (Document Summarization using Weighting based on Cloud)

  • 박선;김철원
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2013년도 추계학술대회
    • /
    • pp.305-306
    • /
    • 2013
  • 본 논문은 클라우드 기반의 가중치에 의한 문서요약 방법을 제안한다. 제안된 방법은 연관피드백을 이용하여 사용자의 간섭을 최소화 시키며, 클라우드 기반의 비음수 행렬분해를 이용한 의미특징으로부터 유도된 용어의 가중치는 문장집합의 내부 특징을 잘 나타나기 때문에 문서요약의 질을 향상할 수 있다.

  • PDF

클라우드 기반의 가중치에 의한 문서요약 (Document Summarization using Weighting based on Cloud)

  • 박선;김철원
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2013년도 추계학술대회
    • /
    • pp.968-969
    • /
    • 2013
  • 본 논문은 클라우드 기반의 가중치에 의한 문서요약 방법을 제안한다. 제안된 방법은 연관피드백을 이용하여 사용자의 간섭을 최소화 시키며, 클라우드 기반의 비음수 행렬분해를 이용한 의미특징으로부터 유도된 용어의 가중치는 문장집합의 내부 특징을 잘 나타나기 때문에 문서요약의 질을 향상할 수 있다.

  • PDF

다양한 어휘 가중치를 이용한 블로그 포스트의 자동 분류 (Automatic Classification of Blog Posts using Various Term Weighting)

  • 김수아;조희선;이현아
    • Journal of Advanced Marine Engineering and Technology
    • /
    • 제39권1호
    • /
    • pp.58-62
    • /
    • 2015
  • 대부분의 블로그 사이트에서는 미리 정의된 분류 체계에 따른 내용 기반 분류 환경을 제공하고 있으나, 작성된 포스트의 분류를 수동으로 선택해야하는 번거로움 때문에 대부분의 블로거들은 포스트에 대한 분류를 입력하지 않고 있다. 본 논문에서는 블로그 포스트의 자동 분류를 위해 블로그 사이트에서 분류별 문서를 수집하고 수집된 분류별 문서의 어휘빈도와 문서빈도, 분류별 빈도 등의 다양한 어휘 가중치 조합하여 블로그 포스트의 특성에 적합한 가중치 방식을 찾고자 한다. 실험에서는 본 논문에서 제안한 TF-CTF-IECDF를 어휘 가중치로 사용한 분류 모델이 77.02%의 분류 정확률을 보였다.

Issues and Empirical Results for Improving Text Classification

  • Ko, Young-Joong;Seo, Jung-Yun
    • Journal of Computing Science and Engineering
    • /
    • 제5권2호
    • /
    • pp.150-160
    • /
    • 2011
  • Automatic text classification has a long history and many studies have been conducted in this field. In particular, many machine learning algorithms and information retrieval techniques have been applied to text classification tasks. Even though much technical progress has been made in text classification, there is still room for improvement in text classification. In this paper, we will discuss remaining issues in improving text classification. In this paper, three improvement issues are presented including automatic training data generation, noisy data treatment and term weighting and indexing, and four actual studies and their empirical results for those issues are introduced. First, the semi-supervised learning technique is applied to text classification to efficiently create training data. For effective noisy data treatment, a noisy data reduction method and a robust text classifier from noisy data are developed as a solution. Finally, the term weighting and indexing technique is revised by reflecting the importance of sentences into term weight calculation using summarization techniques.

불감대를 사용한 최소자승법의 일반화 (A Generalized Least Square Method using Dead Zone)

  • 이하정;최종호
    • 대한전기학회논문지
    • /
    • 제37권10호
    • /
    • pp.727-732
    • /
    • 1988
  • In this paper, a parameter estimation method of linear systems with bounded output disturbances is studied. The bound of the disturbances is assumed to known Weighting factors are proposed to modify LS(Least Square) algorithm in the parameter estimation method. The conditions of weighting factors are given so that the estimation method has good convergence properties. This condition is more relaxed form than other known conditions. The compensation term in the estimation equations is represented by a function of the output prediction error and this function should lie in a specified region on x-y plane to satisfy these conditions of weighting factors. A set of weighting factor is selected and an algorithm is proposed using this set of weighting factor. The proposed algorithm is compared with another existing algorithm by simulation and its performance in parameter estimation id discussed.

  • PDF