• Title/Summary/Keyword: 주제어 추출

Search Result 149, Processing Time 0.027 seconds

Relation Analysis Among Academic Research Areas Using Subject Terms of Domestic Journal Papers (국내 학술지 논문의 주제어를 통한 학술연구분야 관계분석)

  • Lee, Hye-Young;Kwak, Seung-Jin
    • Journal of the Korean BIBLIA Society for library and Information Science
    • /
    • v.22 no.3
    • /
    • pp.353-371
    • /
    • 2011
  • The purpose of this paper is to analyze the interrelation among research areas based on domestic journal papers, achievements of korea researchers. Generally, the content of papers is appeared through abstracts, subjects, full-text and so on. This paper is focused on subject terms of Domestic journal papers. The experimental data are 80 domestic journals, 7,616 papers and 58,143 subject terms and papers published in 2009. As the result, it was different to use subject terms on each research area: Engineering, Agriculture & Oceanography, Interdisciplinary Science, Social Science, Arts & Physical Education, Medicine & Pharmacology, Humanities and Natural Science. Subject terms of Engineering have used the most in the other research areas in aspect of term co-occurrence. The 8 research areas were grouped in 3 clusters: C1(Engineering, Natural Science, Social Science, Interdisciplinary Science, Humanities), C2(Medicine & Pharmacology, Arts & Physical Education), and C3(Agriculture & Oceanography).

A Sentence Theme Allocation Scheme based on Head Driven Patterns in Encyclopedia Domain (백과사전 영역에서 중심어주도패턴에 기반한 문장주제 할당 기법)

  • Kang Bo-Young;Myaeng Sung-Hyon
    • Journal of KIISE:Software and Applications
    • /
    • v.32 no.5
    • /
    • pp.396-405
    • /
    • 2005
  • Since sentences are the basic propositional units of text, their themes would be helpful for various tasks that require knowledge about the semantic content of text. Despite the importance of determining the theme of a sentence, however, few studies have investigated the problem of automatically assigning the theme to a sentence. Therefore, we propose a sentence theme allocation scheme based on the head-driven patterns of sentences in encyclopedia. In a serious of experiments using Dusan Dong-A encyclopedia, the proposed method outperformed the baseline of the theme allocation performance. The head-driven pattern 4, which is reconfigured based on the predicate, showed superior performance in the theme allocation with the average F-score of $98.96\%$ for the training data, and $88.57\%$ for the test data.

Term Weighting Method by Postposition and Compound Noun Recognition (조사 유형 및 복합명사 인식에 의한 용어 가중치 부여 기법)

  • 강승식;이하규;손소현;홍기채;문병주
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2001.10b
    • /
    • pp.196-198
    • /
    • 2001
  • 문서의 내용을 대표하는 용어를 추출하기 위해 일반적으로 영어에서는 명사구를 색인하는 기법을 사용하지만 주제어 추출의 관점에서 영어의 명사구가 한국어의 복합명사에 해당하기 때문에 한국어에서는 복합명사 색인 기법을 중요시하고 있다. 본 논문에서는 한글 문서에서 추출된 용어의 가중치를 결정하기 위하여 경험적인 방법에 따라 가중치를 계산하는 방법을 제안한다. 구체적인 가중치 계산 방법으로 용어 자체의 특성에 의한 가중치를 부여한 후에, 복합명사의 경계를 인식하여 띄어쓴 복합명사의 가중치를 조절하고, 다시 용어의 조사 유형에 따라 가중치를 재계산하는 방법을 제안한다. 신문기사에 대한 실험결과에 의하면 제안한 방법이 단순 출현빈도에 의한 주제어 추출 기법보다 정확도가 더 높았다.

  • PDF

Efficient Blog Retrieval System by Topic-based Weighting (주제어 가중치 기법에 의한 효율적인 블로그 검색 시스템)

  • Shin, Hyeon-Il;Yun, Un-Il;Ryu, Keun-Ho
    • Journal of the Korea Society of Computer and Information
    • /
    • v.15 no.4
    • /
    • pp.1-9
    • /
    • 2010
  • In the new generation of Web, commonly called "Web 2.0", blogging has facilitated the publishing information or his/her opinion on the web. Various blog retrieval algorithms have been proposed to search for blogs more effectively. However, actually keyword-based searching or link-analysis blog ranking system cannot satisfy the user's requirement. In this paper, we suggest a topic-based weighting blog retrieval system in which the links between blog writings and searching words are considered to improve the search results. Our system extracts topics from each blog and weights them much higher than other guide words. In the comparison with other systems, we see that the proposed topic-base system has better recall rate of search results.

Predicates Indexing for efficiency improvement in Korean Information Retrieval System (한국어 정보검색 시스템의 성능 향상을 위한 용언 색인)

  • 박진희;박대원;박민식;남현숙;김광영;권혁철
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2000.10b
    • /
    • pp.164-166
    • /
    • 2000
  • 지금까지 대부분의 정보검색 시스템은 명사만을 색인어로 추출하여 사용하였다. 명사는 문서를 대표할 수 있는 어휘 요소이다. 그러나 명사 색인어만 가지고는 문서의 주제를 정확하게 나타낼 수 없다. 본 논문은 명사 색인어와 함께 용언도 색인어로 추출하여 사용하는 한국어 정보 검색시스템을 제시한다. 또한, 용역 색인어와 명사 색인어의 상대적 가중치를 검색에 이용하여 사용자의 질의에 적합한 문서를 검색할 수 있도록 한다. 이러한 과정에서 발견된 문제점은 향후 연구 과제로 계속 향상시켜나갈 것이다.

  • PDF

A Study on the Direction of Art Policy through Semantic Network Analysis in New Normal Era (뉴노멀(New Normal) 시대 언어네트워크 분석에 의한 예술정책 방향 연구)

  • Kim, Mi Yeon;Kwon, Byeong Woong
    • Korean Association of Arts Management
    • /
    • no.58
    • /
    • pp.153-177
    • /
    • 2021
  • This study attempted to analyze language networks based on the theory of art policy in the New Normal era triggered by COVID-19 and domestic and foreign policy trends. For analysis, data containing key words of "Corona" and "Art" were collected from Google News and Web documents from March to September 2020 to extract 227 refined subject words, and the extracted subject words were analyzed as indicators of frequency and centrality of subject words through the Netminor program. In addition, visualization analysis of semantic networks has been attempted for the analysis of relationships between each topic languages. As a result of the semantic network analysis, the most frequent topic was "Corona," and "Culture and Art," "Art," "Performance," "Online" and "Support" were included in the group with the most frequencies. In the centrality analysis, "Corona" was the most popular, followed by "the era," "after," "post," "art," and "cultural arts," with high frequency, "Corona," "art," and "cultural arts" also dominated most centrality. In particular, the top-level key words in the analysis of frequency and centrality of the topic are 'online' and 'support' and 'policy'. This can be seen as indicating that the rapid rise of non-face-to-face and online content and support policies for the artistic communities are needed due to the dailyization of social distance due to COVID-19.

Study on the Vocabulary Synthesis for Index Term Selection (색인어 선정을 위한 어휘결집력에 관한 연구)

  • Kim, Chul;Jeong, Jun-Min
    • Journal of the Korean Society for information Management
    • /
    • v.13 no.1
    • /
    • pp.205-226
    • /
    • 1996
  • Under the hypothesis that any pair of terms in the sentence is meaningful to present the context of the paper, the Brillouin measure of term relatedness in automatic indexing is proposed. For the experiment, the pair of terms simul-taneously appeared in two or more sentences of the paper are extracted from the title and abstract of the paper. Com-pared with the list of index terms or subject headings suggested by the author, the terms in term relatedness graph are highly matched with the terms in the list. Especially, it is revealed that the rank of terms by synthetic strength is use-ful in the selection of index terms.

  • PDF

Concept-based Search Engine System Using MeSH (MeSH를 이용한 개념 기반 검색 엔진 시스템)

  • 고삼일;박사준;황수철;김기태
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2003.04c
    • /
    • pp.383-385
    • /
    • 2003
  • 본 논문에서는 개념 기반 검색엔진 시스템(Concept-based Search Engine System)의 검색 정확도를 향상시키기 위한 방법으로 MeSH를 이용하였다. MeSH는 Medical Subject Headings의 약자로서 MEDLINE 논문의 원활한 검색을 위하여 주제어를 코드화한 것으로 이를 개념 그래프의 시소러스로 사용하여 개념 그래프의 가장 중요한 부분인 개념 추출의 정확성을 보장하도록 하였다. 본 논문은 2003년 MeSH의 Descriptor Data의 Term 항목을 사용하여 개념과 관련이 있는 유의어를 추출했다. 추출된 유의어로 개념 그래프를 구성한 것과 문서 내에서의 단어 빈도수에 의하여 개념 그래프를 구성한 것의 검색 결과를 비교한 결과 MeSH 를 시소러스로 사용하여 개념 그래프를 구성한 것이 훨씬 더 정확한 결과를 내는 것을 확인할 수 있었다.

  • PDF

Dynamic Expansion of Semantic Dictionary for Topic Extraction in Automatic Summarization (자동요약의 주제어 추출을 위한 의미사전의 동적 확장)

  • Choo, Kyo-Nam;Woo, Yo-Seob
    • Journal of IKEEE
    • /
    • v.13 no.2
    • /
    • pp.241-247
    • /
    • 2009
  • This paper suggests the expansion methods of semantic dictionary, taking Korean semantic features account. These methods will be used to extract a practical topic word in the automatic summarization. The first is the method which is constructed the synonym dictionary for improving the performance of semantic-marker analysis. The second is the method which is extracted the probabilistic information from the subcategorization dictionary for resolving the syntactic and semantic ambiguity. The third is the method which is predicted the subcategorization patterns of the unregistered predicate, for the resolution of an affix-derived predicate.

  • PDF

Use of Text Processing Technologies in a Semantic Web Application (시맨틱 웹 응용 서비스에서의 텍스트 처리 기술 적용)

  • Jung, Han-Min;Kang, In-Su;Koo, Hee-Kwan;Lee, Seung-Woo;Kim, Pyung;Sung, Won-Kyung
    • Annual Conference on Human and Language Technology
    • /
    • 2006.10e
    • /
    • pp.189-196
    • /
    • 2006
  • 본 논문은 시맨틱 웹 응용 서비스를 구현함에 있어 필수적으로 요구되는 온톨로지 인스턴스 구축을 효율적으로 처리하는 데 있어 텍스트 처리 기술이 어떤 역할을 수행할 수 있는 가를 $OntoFrame-K^{(R)}$라는 시맨틱 웹 기반 정보 유통 체계에의 적용 사례를 통해 살펴본다. 본 논문에서 소개하는 텍스트 처리 기술은 개체 확인물 통한 개념 사례화, 주제 분야 할당을 통한 메타데이터 확장에, 그리고 인용 정보 추출 및 인용 관계 구축을 통한 객체 관계속성 구축에 적용된다. 개체 확인에서는 메타데이터 비교 잊 병합을 사용하였으며 이를 기반으로 한 수작업 구축을 통해 8,543명의 인력 URI를 확보하였다. 주제 및 분야 할당에서는 색인어와 분야분류명이 매핑된 시소러스 개념어의 매칭을 통해 색인어 별 TF (Term Frequency), 색인어와 매칭된 개념어 별 TF, 색인어와 매칭된 개념어 별 시소러스에서의 깊이, 색인어와 매칭된 개념어 별 개념 패싯, 색인어와 매칭된 각 개념어에 부착된 분야분류명 목록 등 할당을 위한 다양한 자질을 확보 적용하였다. 인용 정보 추출과 인용 관계 구축에서는 객체 URI와 인력 URI를 기반으로 하여 자동 추출된 인용 정보를 반영하는 방식으로 7,237개 문헌으로부터 총 135개의 인용 네트워크 그룹을 자동으로 확보하였다. 본 연구를 통해 제시된 텍스트 처리 기술의 활용 방안이 향후 시맨틱 웹 응용 서비스 및 인프라 구현에서 다각적으로 활용될 수 있기를 기대한다.

  • PDF