• Title/Summary/Keyword: 정보범주

Search Result 1,317, Processing Time 0.03 seconds

A Study on Calculating Over-sampling Ratio using Classification Complexity (분류 복잡도를 활용한 오버 샘플링 비율 산출 알고리즘 개발)

  • Lee, Do-Hyeon;Kim, Kyoungok
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2020.05a
    • /
    • pp.591-594
    • /
    • 2020
  • 불균형 데이터는 범주에 따른 데이터의 분포가 불균형한 데이터를 의미한다. 이런 데이터를 활용해 기존 분류 알고리즘으로 분류기를 학습하면 성능이 저하되는 문제가 발생한다. 오버 샘플링은 이를 해결하기 위한 기법 중 하나로 수가 적은 범주[이하 소수 범주]에 속한 데이터 수를 임의로 증가시킨다. 기존 연구들에서는 수가 많은 범주[이하 다수 범주]에 속한 데이터 수와 동일한 크기만큼 증가시키는 경우가 많다. 이는 증가시키는 샘플의 수를 결정할 때 범주 간 데이터 수 비율만 고려한 것이다. 그런데 데이터가 동일한 수준의 불균형 정도를 갖더라도 범주별 데이터 분포에 따라서 분류 복잡도가 다르며, 경우에 따라 데이터 분포에서 존재하는 불균형 정도를 완전히 해소하지 않아도 된다. 이에 본 논문은 분류 복잡도를 활용해 데이터 셋 별 적정 오버 샘플링 비율을 산출하는 알고리즘을 제안한다.

A Hypertext Categorization Model Exploiting Link and Incrementally Available Category Information (점진적으로 계산되는 분류정보와 링크정보를 이용한 하이퍼텍스트 문서 분류 모델)

  • Oh, Hyo-Jung;Lim, Jeong-Mook;Lee, Mann-Ho;Myaeng, Sung-Hyon
    • Annual Conference on Human and Language Technology
    • /
    • 1999.10e
    • /
    • pp.89-96
    • /
    • 1999
  • 본 논문은 하이퍼텍스트가 갖는 중요한 특성인 링크 정보를 활용한 문서 분류 모델을 제안한다. 하이퍼링크는 문서간의 관계를 나타내는 유용한 정보로서 링크를 통해 연결된 두 문서는 내용적으로 관련이 있어 검색에 도움을 준다는 것은 이미 밝혀진바 있다. 본 논문에서는 이러한 과거 연구를 바탕으로 새로운 문서 분류 모델을 제안하는데, 이 모델의 주안점은 대상 문서와 링크로 연결된 이웃 문서의 내용 및 범주를 분석하여 대상 문서 벡터를 조정하고, 이를 근거로 문서의 범주를 결정한다. 이웃 문서에 포함된 용어를 반영함으로써 대상 문서의 내용을 확장 해석하고, 이웃 문서의 가용 분류 정보가 있는 경우 이를 참조함으로써 정확도 향상을 기한다. 이 모델은 이웃한 문서의 범주가 미리 할당되어 있지 않은 경우 용어 기반 분류 방법으로 가용 범주를 할당하고, 이렇게 할당된 분류 정보가 다시 새로운 문서의 범주를 결정할 때 사용됨으로써, 문서 집합 전체의 분류가 점진적으로 이루어지며 그 정확도를 더해 나가는 효과를 가져올 수 있다. 이러한 접근 방법은 일반 웹 환경에 적용할 수 있는데, 특히 하이퍼텍스트를 주제별로 분류하여 관리하는 검색 엔진의 경우 매일 쏟아져 나오는 새로운 문서와 기존 문서간의 링크를 활용함으로써 전체 시스템의 점진적인 분류에 매우 유용하다. 제안된 모델을 검증하기 위하여 Reuter-21578과 계몽사(ETRI-Kyemong) 자료를 대상으로 실험한 결과 18.5%의 성능 향상을 얻었다.

  • PDF

Improving Performance of Search Engine Using Category based Evaluation (범주 기반 평가를 이용한 검색시스템의 성능 향상)

  • Kim, Hyung-Il;Yoon, Hyun-Nim
    • The Journal of the Korea Contents Association
    • /
    • v.13 no.1
    • /
    • pp.19-29
    • /
    • 2013
  • In the current Internet environment where there is high space complexity of information, search engines aim to provide accurate information that users want. But content-based method adopted by most of search engines cannot be used as an effective tool in the current Internet environment. As content-based method gives different weights to each web page using morphological characteristics of vocabulary, the method has its drawbacks of not being effective in distinguishing each web page. To resolve this problem and provide useful information to the users, this paper proposes an evaluation method based on categories. Category-based evaluation method is to extend query to semantic relations and measure the similarity to web pages. In applying weighting to web pages, category-based evaluation method utilizes user response to web page retrieval and categories of query and thus better distinguish web pages. The method proposed in this paper has the advantage of being able to effectively provide the information users want through search engines and the utility of category-based evaluation technique has been confirmed through various experiments.

Category Reorganization with Ontology Information: Roget Thesaurus Case (온톨로지 정보를 이용한 범주 재편성: Roget 시소러스의 경우)

  • Yang, Jae-Gun;Bae, Jae-Hak
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2002.04a
    • /
    • pp.515-518
    • /
    • 2002
  • 본 논문에서는 Roget 시소러스의 범주를 재편성하여 문장추상화에 사용할 온톨로지를 추측하였다. Roget 시소러스의 표제정보와 참조정보를 이용해서 범주를 재편성한 각 결과를 토대로, OfN(Ontology for Narratives)을 구성하였다. 이렇게 하여 얻어진 OfN을 설화 문장추상화에 적용하여 이 온톨로지가 유의함을 확인하였다.

  • PDF

Korean Semantic Role Labeling using Case Frame and Subcategory of Predicate (한국어 격틀 사전과 용언의 하위 범주 정보를 사용한 한국어 의미역 결정)

  • Kim, Wansu;Ock, CheolYoung
    • Annual Conference on Human and Language Technology
    • /
    • 2015.10a
    • /
    • pp.198-201
    • /
    • 2015
  • 의미역 결정은 문장의 서술어와 그 서술어에 속하는 논항들 사이의 의미관계를 결정하는 문제이다. 본 논문에서는 UPropBank 격틀 사전과 UWordMap의 용언의 하위 범주 정보를 이용하여 의미역을 부착하였다. 실험 결과 80.125%의 정확률로 의미역을 부착하는 성능을 보였다.

  • PDF

Automatic Text Categorization based on Semi-Supervised Learning (준지도 학습 기반의 자동 문서 범주화)

  • Ko, Young-Joong;Seo, Jung-Yun
    • Journal of KIISE:Software and Applications
    • /
    • v.35 no.5
    • /
    • pp.325-334
    • /
    • 2008
  • The goal of text categorization is to classify documents into a certain number of pre-defined categories. The previous studies in this area have used a large number of labeled training documents for supervised learning. One problem is that it is difficult to create the labeled training documents. While it is easy to collect the unlabeled documents, it is not so easy to manually categorize them for creating training documents. In this paper, we propose a new text categorization method based on semi-supervised learning. The proposed method uses only unlabeled documents and keywords of each category, and it automatically constructs training data from them. Then a text classifier learns with them and classifies text documents. The proposed method shows a similar degree of performance, compared with the traditional supervised teaming methods. Therefore, this method can be used in the areas where low-cost text categorization is needed. It can also be used for creating labeled training documents.

A Study of Korean Geographic Area Classification Systems (한국 지리구분 분류체계에 관한 연구)

  • 곽철완
    • Journal of Korean Library and Information Science Society
    • /
    • v.35 no.2
    • /
    • pp.135-154
    • /
    • 2004
  • This study was investigated to the geographical categories and arrangement of library classifications and public organizations in ender to understand the geographical category comprehension and canon from the north-west to south-east in Korean library classification and then to develop a Korean geographical classification system Research method was the examination of different type of library classification (DDC, NDC, LCC) and geographical categorizations of the public organizations. The results show that there was not a principle of categorization and arrangement for geographical information. This study proposes to the three hierarchical structures and radial category arrangement from center-area to side area for developing Km geographical classification.

  • PDF

Category Reorganization for Ontology Reuse (온톨러지 재사용을 위한 범주 재분류)

  • Yang Jae-Gun;Lee Jong-Hyeok;Bae Jae-Hak J.;Bae Jae-Hak J.
    • The KIPS Transactions:PartB
    • /
    • v.12B no.1 s.97
    • /
    • pp.69-80
    • /
    • 2005
  • This paper introduces a methodology of transforming an existing ontology into the one that satisfies its application. The transformation consists of simplification and realization of word category information. They are based on category headings and base categories. Furthermore, this paper describes a method by which we can identify relationships between category sets. Through the transformation, (1) Roget's thesaurus is reorganized into 7 categories and the base of 'Ontology for Narrative'[32], (2) 22 immersion factors of multimedia games can be subdivided into 207 factors in [35], and (3) the relationships between 10 mental factors and 22 immersion factors of multimedia games are identified in [36].

A Comparative Study on Category Assignment Methods of a KNN Classifier (KNN 분류기의 범주할당 방법 비교 실험)

  • 이영숙;정영미
    • Proceedings of the Korean Society for Information Management Conference
    • /
    • 2000.08a
    • /
    • pp.37-40
    • /
    • 2000
  • KNN(K-Neatest Neighbors)을 사용한 문서의 자동분류에서는 새로운 입력문서에 범주를 할당하기 위해 K개의 유사문서로부터 범주별 문서의 분류빈도나 유사도를 이용한다. 본 연구에서는 KNN 기법에서 보편적으로 사용되는 범주 할당 방법을 응용하여 K개 유사문서 중 최상위 및 상위 M개 문서에 가중치를 부여하는 방법들을 고안하였고 K값의 변화에 따른 이들의 성능을 비교해 보았다.

  • PDF

Holding Power Analysis of Multimedia Games with Ontology Information (온톨로지 정보를 이용한 멀티미디어 게임 흡인력 분석)

  • 정혜영;조윤경;배재학
    • Proceedings of the Korean Society for Cognitive Science Conference
    • /
    • 2002.05a
    • /
    • pp.15-20
    • /
    • 2002
  • 본 논문에서는 몰입이론을 기초로 멀티미디어 게임의 흡인요소를 분석하였다. 인지 및 감성을 고려한 흡인요소에는 22가지가 있었다. 이 흡인요소를 Roget 시소러스 (Roget Thesaurus)의 기저범주로 간주하였다. 이 기저범주를 바탕으로 참조정보를 이용하여 가까운 반경 안의 새주운 범주를 탐색하였다. 그 결과, 22가지 게임의 흡인요소 범주를 229가지로 세분화시킬 수 있음을 알았다.

  • PDF