• 제목/요약/키워드: automatic indexing

검색결과 138건 처리시간 0.023초

구문 . 통계적 기법을 이용한 한국어 자동색인에 관한 연구 (An experiment in automatic indexing with korean texts : a comparison of syntactico-statistical and manual methods)

  • 서은경
    • 정보관리학회지
    • /
    • 제10권1호
    • /
    • pp.97-124
    • /
    • 1993
  • 본 논문은 자연어 형태의 한국어 텍스트 부터 주제를 대표할 수 있는 색인어를 자동으로 추출하는 실험적인 구문 . 통계적 자동색인 시스템을 구현하였다. 구문 . 통계적 자동색인 시스템은 형태소 분석과 단어 가증 기법을 이용하여 단일어와 명사구를 동시에 선택하는 자동색인 시스템을 말한다. 시스템의 성능을 측정하기 위하여, 300개의 우리말 학술 및 학위논문 초록에서 선택된 단일 . 복합어 색인어를 수작업 색인과 비교하였다. 이와 같은 실험 결과를 가지고 아직 미흡한 연구상태인 우리말 자동색인 개발에 있어서 필요한 기초자료를 제시하였다.

  • PDF

주제분석기법으로서의 자동색인 (Automatic indexing as a subject analysis technique)

  • 이영자
    • 한국도서관정보학회지
    • /
    • 제12권
    • /
    • pp.61-96
    • /
    • 1985
  • The human subject analysis of a document has some critical problems. The method results in the inconsistency in analysis process and the contradiction of two objects of the subject analysis (one is the identification of the content for the retrieval of specific items and the other is to identify the content for the grouping of related materials). Since the subject analysis by mechanized has been recognized to be the possible way to aggregate the problems of manual analysis, various a n.0, pproaches of automatic indexing have been studied and experimented. This study is to examine the automatic indexing as one of the promising subject analysis techniques by statistical, syntactical and semantic a n.0, pproaches. In conclusion, the reasonable a n.0, pplication time of the automatic indexing should be made a decision based on the through investigation on the cost verse effectiveness, and automatic indexing system should be developed in the close relationship with the on-line search which is a good retrieval system for information explosion society. From now on, since the machine-readable document-text will be envisaged to be more and more available due to the rapid development of computer technology, the more substantial research on the automatic indexing will be also possible, which can bring about the increasing of practical automatic indexing systems.

  • PDF

신문기사(新聞記事) 자동색인(自動索引)에 관한 고찰(考察) (A Study on Automatic Indexing System for Newspaper Articles)

  • 조선희
    • 정보관리연구
    • /
    • 제23권3호
    • /
    • pp.19-44
    • /
    • 1992
  • 최근 국내(國內) 대부분의 신문사(新聞社)에서 CTS시스템을 도입함에 따라 기사전문(記事全文)이 컴퓨터에 입력되는 장점을 고려한 자동색인(自動索引) 시스템의 필요성이 대두되고 있다. 본 연구에서는 선행연구(先行硏究)와 국내외(國內外) 사례(事例)들을 통해 신문기사 자동색인 시스템의 문제점(間題點)과 앞으로의 전망(展望)을 고찰하였다.

  • PDF

동영상 등장인물의 자동색인을 위한 효율적인 저장과 검색 방법 (Efficient Storage and Retrieval for Automatic Indexing of Persons in Videos)

  • 김진승;한용구;이영구
    • 한국멀티미디어학회논문지
    • /
    • 제14권8호
    • /
    • pp.1050-1060
    • /
    • 2011
  • 대용량 동영상을 대상으로 한 등장인물 색인에 대한 수요가 증가함에 따라, 많은 시간과 비용이 소요되는 수동 태깅의 단점을 보완할 수 있는 자동 태깅을 이용한 자동 색인이 연구되고 있다. 하지만, 자동 색인은 인물을 100% 정확하게 검출하지 못하므로 검출된 인물에 대해 정확도를 함께 표현해야 한다. 본 논문에서는 이러한 정보를 포스팅 리스트에 효율적으로 저장하는 방법과 등장인물의 검색시 관련 동영상들을 효율적으로 찾기 위한 순위 결정 방법을 제안한다. 실험을 통하여 제안하는 색인 정보 저장 방법이 포스팅 리스트의 압축에 효과적임을 입증하였다. 또한 제안한 순위 결정 방법이 관련 동영상을 찾는데 효과적임을 입증하였다.

자동색인의 이론과 실제 (Theory and Practice of Automatic Indexing)

    • 한국도서관정보학회지
    • /
    • 제30권3호
    • /
    • pp.27-51
    • /
    • 1999
  • This paper deals with the methods as well as the problems associated with automatic extraction indexing and assignment indexing, expert systems for indexing, and major approaches currently used to index the Internet resources. It also briefly reviews basic methods for establishing hypertext/hypermedia links automatically. The methods used in much of text processing today are not particularly new. Most of the them were used, perhaps in a more rudimentary form, 30 or more years ago by Luhn and many other investigators. Better results can be achieved today because much greater bodies of electronic text are now avaliable and the power of present-day computers allows the processing of such text with reasonable efficiency.

  • PDF

로치오 알고리즘을 이용한 학술지 논문의 디스크 립터 자동부여에 관한 연구 (A Study on the Automatic Descriptor Assignment for Scientific Journal Articles Using Rocchio Algorithm)

  • 김판준
    • 정보관리학회지
    • /
    • 제23권3호
    • /
    • pp.69-89
    • /
    • 2006
  • 로치오 알고리즘에 기초한 통제어휘 자동색인 또는 텍스트 범주화에서 적용되어 온 여러 성능 요인들을 재검토하였고, 성능 향상을 위한 기본적인 방법을 찾아보았다. 또한, 동등한 조건에서 통제어휘 자동색인을 위한 로치오 알고리즘 기반 방법의 성능을 다른 학습기반 방법들의 성능과 비교하였다. 결과에 따르면, 통제어휘 자동색인을 위한 로치오 기반의 프로파일 방법은 구현의 용이성과 컴퓨터 처리시간 측면의 경제성이라는 기존의 장점을 그대로 유지하면서도, 다른 학습기반 방법들(SVM, VPT, NB)과 거의 동등하거나 더 나은 성능을 보여주었다. 특히, 색인전문가의 색인작업을 지원하는 반-자동 색인의 목적으로는 비교적 높은 수준의 재현율을 유지하면서 학습 데이터의 증가에 따라 정확률이 크게 향상되는 로치오 알고리즘을 이용한 방법을 우선적으로 고려할 수 있을 것이다.

언어학적 분석기법에 의한 신문기사 자동색인시스팀 설계에 관한 연구 (A Study of automatic indexing based on the linguistic analysis for newspaper articles)

  • 서경주;사공철
    • 정보관리학회지
    • /
    • 제8권1호
    • /
    • pp.78-99
    • /
    • 1991
  • 본 연구는 전자신문인 한경 KETEL의 기사 전문을 대상으로 키워드를 자동 추출하는 자동색인 시스팀을 구축한 것으로서 한글의 형태적 특성을 이용한 언어학적 분석기법을 적용해서 키워드 화일을 생성하는 법을 제시하였으며, 불용어리스트 조사표 용언인식표의 작성법을 상세히 기술했다. 본 연구에서 얻어진 결론은 다음과 같다. 첫째, 형태소 분석을 통한 자동색인 기법으로 만족할 만한 키워드를 추출할 수 있었다. 둘째, 아직까지는 컴퓨터에 의한 한글의 구문분석과 의미분석이 완전하지 못하므로 자동색인으로 추출된 색인어를 색인자가 조절함으로써 색인의 성능을 향상시킬 수 있었다. 셋째, 이 시스팀에서 만들어진 약 20,000어 정도의 키워드 화일은 향후 디소러스 작성에 기본 자료로 사용할 수 있다. 넷째, 본 시스팀에서는 역순사전을 활용해 조사표와 용언인식표 작성법을 제시하였는데, 이는 여러 자동색인 시스팀 설계에 적용될 수 있을 것이다.

  • PDF

Automatic Name Line Detection for Person Indexing Based on Overlay Text

  • Lee, Sanghee;Ahn, Jungil;Jo, Kanghyun
    • Journal of Multimedia Information System
    • /
    • 제2권1호
    • /
    • pp.163-170
    • /
    • 2015
  • Many overlay texts are artificially superimposed on the broadcasting videos by humans. These texts provide additional information to the audiovisual content. Especially, the overlay text in news videos contains concise and direct description of the content. Therefore, it is most reliable clue for constructing a news video indexing system. To make the automatic person indexing of interview video in the TV news program, this paper proposes the method to only detect the name text line among the whole overlay texts in one frame. The experimental results on Korean television news videos show that the proposed framework efficiently detects the overlaid name text line.

A One-Size-Fits-All Indexing Method Does Not Exist: Automatic Selection Based on Meta-Learning

  • Jimeno-Yepes, Antonio;Mork, James G.;Demner-Fushman, Dina;Aronson, Alan R.
    • Journal of Computing Science and Engineering
    • /
    • 제6권2호
    • /
    • pp.151-160
    • /
    • 2012
  • We present a methodology that automatically selects indexing algorithms for each heading in Medical Subject Headings (MeSH), National Library of Medicine's vocabulary for indexing MEDLINE. While manually comparing indexing methods is manageable with a limited number of MeSH headings, a large number of them make automation of this selection desirable. Results show that this process can be automated, based on previously indexed MEDLINE citations. We find that AdaBoostM1 is better suited to index a group of MeSH hedings named Check Tags, and helps improve the micro F-measure from 0.5385 to 0.7157, and the macro F-measure from 0.4123 to 0.5387 (both p < 0.01).

계층적 결합형 문서 클러스터링 시스템과 복합명사 색인방법과의 연관관계 연구 (The Experimental Study on the Relationship between Hierarchical Agglomerative Clustering and Compound Nouns Indexing)

  • 조현양;최성필
    • 한국문헌정보학회지
    • /
    • 제38권4호
    • /
    • pp.179-192
    • /
    • 2004
  • 본 논문에서는 복합명사에 대한 색인 방법을 다각적으로 적용하여 계층적 결합 문서 클러스터링 시스템의 결과를 분석한다. 우선 한글 색인 엔진과 HAC(Hierarchical Agglomerative Clustering) 엔진에 대해서 설명하고 한글 색인 엔진에서 제공되는 3가지 복합명사 분석 모드에 대해서 기술한다. 또한 구현된 클러스터링 엔진의 특징과 속도 향상을 위한 기법 등을 예시한다. 실험에서는 3가지 복합명사 색인 방법을 기준으로 문서 클러스터링을 수행하고, 실험 결과에 대한 분석에서 복합명사에 대한 색인 방법이 문서 클러스터링의 결과에 직접적인 영향을 준다는 것을 보여준다.