• 제목/요약/키워드: Document information retrieval

검색결과 410건 처리시간 0.027초

문서필터링을 위한 질의어 확장과 가중치 부여 기법 (Query Expansion and Term Weighting Method for Document Filtering)

  • 신승은;강유환;오효정;장명길;박상규;이재성;서영훈
    • 정보처리학회논문지B
    • /
    • 제10B권7호
    • /
    • pp.743-750
    • /
    • 2003
  • 본 논문에서는 문서 필터링을 위한 질의어 확장과 가중치 부여 기법을 제안한다. 문서 필터링은 웹 검색 엔진들에 대한 검색 결과의 정확률 향상을 목적으로 한다. 문서 필터링을 위한 질의어 확장은 개념망, 백과사전, 유사도 상위 10% 문서를 이용하며, 각각의 확장 질의어에 가중치를 부쳐하여 질의어와 문서들간의 유사도를 계산한다. 첫 번째 단계에서 개념망과 백과사전을 이용하여 초기 질의어에 대한 1차 확장 질의어를 생성하고, 1차 확장 질의엉 가중치를 부여하여 질의어와 문서들간의 유사도를 계산한다. 다음 단계에서는 높은 유사도를 갖는 상위 10% 문서들을 이용하여 2타 확장 질의어를 생성하고, 2차 확장 질의어에 가중치를 부쳐하여 질의어와 문서들간의 유사도를 계산한다. 다음으로 1차 유사도와 2차 유사도를 결합하여 문서들을 재순위화하고, 임계치보다 낮은 유사도를 갖는 문서들을 필터링함으로써 웹 검색 엔진들의 검색 결과 정확률을 향상시킨다. 실험에서 이러한 문서 필터링을 위한 질의어 확장과 가중치 부여 기법은 정확률-재현율과 F-measure를 이용하여 성능 평가를 할 때 정보 검색 효율성에서 주목할 만한 성능 향상을 보였다.

지식모니터링시스템에서 감성기준을 고려한 EFASIT 모델 (An EFASIT model considering the emotion criteria in Knowledge Monitoring System)

  • 류경현;피수영
    • 인터넷정보학회논문지
    • /
    • 제12권4호
    • /
    • pp.107-117
    • /
    • 2011
  • 웹의 등장은 전통적인 정보검색을 비롯하여 지식관리와 일반 상거래 등 사회 전 분야의 급격한 변혁을 초래하였다. 그러나 검색엔진은 일반적으로 관련된 계산함수에 의해 순서화된 URL의 방대한 목록을 제공하지만, 관련 없는 정보의 필터링이나 사용자가 필요로 하는 정보의 검색에 많은 시간이 소요된다. 본 논문에서는 웹상의 효율적인 문서검색을 위해서 영역 코퍼스 정보를 바탕으로 확장된 퍼지 계층화 의사결정법(Extended Fuzzy AHP Method : EFAM)과 유사도 기법(SImilarity Technology : SIT)을 결합하고, 감성기준을 고려한 EFASIT(Extended Fuzzy AHP and SImilarity Technology)모델을 제안한다. 제안한 감성기준을 고려한 EFASIT 모델은 다양한 의사결정자들의 퍼지지식의 통합으로 좀 더 명확한 규칙을 생성할 수 있고 의사결정을 하는데 도움을 준다는 것을 실험을 통하여 확인한다.

A Natural Language Question Answering System-an Application for e-learning

  • Gupta, Akash;Rajaraman, Prof. V.
    • 한국지능정보시스템학회:학술대회논문집
    • /
    • 한국지능정보시스템학회 2001년도 The Pacific Aisan Confrence On Intelligent Systems 2001
    • /
    • pp.285-291
    • /
    • 2001
  • This paper describes a natural language question answering system that can be used by students in getting as solution to their queries. Unlike AI question answering system that focus on the generation of new answers, the present system retrieves existing ones from question-answer files. Unlike information retrieval approaches that rely on a purely lexical metric of similarity between query and document, it uses a semantic knowledge base (WordNet) to improve its ability to match question. Paper describes the design and the current implementation of the system as an intelligent tutoring system. Main drawback of the existing tutoring systems is that the computer poses a question to the students and guides them in reaching the solution to the problem. In the present approach, a student asks any question related to the topic and gets a suitable reply. Based on his query, he can either get a direct answer to his question or a set of questions (to a maximum of 3 or 4) which bear the greatest resemblance to the user input. We further analyze-application fields for such kind of a system and discuss the scope for future research in this area.

  • PDF

Speaker Tracking Using Eigendecomposition and an Index Tree of Reference Models

  • Moattar, Mohammad Hossein;Homayounpour, Mohammad Mehdi
    • ETRI Journal
    • /
    • 제33권5호
    • /
    • pp.741-751
    • /
    • 2011
  • This paper focuses on online speaker tracking for telephone conversations and broadcast news. Since the online applicability imposes some limitations on the tracking strategy, such as data insufficiency, a reliable approach should be applied to compensate for this shortage. In this framework, a set of reference speaker models are used as side information to facilitate online tracking. To improve the indexing accuracy, adaptation approaches in eigenvoice decomposition space are proposed in this paper. We believe that the eigenvoice adaptation techniques would help to embed the speaker space in the models and hence enrich the generality of the selected speaker models. Also, an index structure of the reference models is proposed to speed up the search in the model space. The proposed framework is evaluated on 2002 Rich Transcription Broadcast News and Conversational Telephone Speech corpus as well as a synthetic dataset. The indexing errors of the proposed framework on telephone conversations, broadcast news, and synthetic dataset are 8.77%, 9.36%, and 12.4%, respectively. Using the index tree structure approach, the run time of the proposed framework is improved by 22%.

색인어 말뭉치 처리를 기반으로 한 웹 정보검색 시스템의 설계 (Design of WWW IR System Based on Keyword Clustering Architecture)

  • 송점동;이정현;최준혁
    • 정보학연구
    • /
    • 제1권1호
    • /
    • pp.13-26
    • /
    • 1998
  • 대부분의 정보검색시스템들은 부적절한 색인어들에 의해 가끔 사용자의 의도에 맞지 않는 전혀 다른 검색 결과가 나타난다. 그것은 시스템이 색인어들을 검색하기 위해 그 의미가 아닌, 단지 용어로서만 고려하기 때문이다. 검색 정확도의 증진을 위해 색인어는 연관된 용어 사용 빈도와 역 빈도 사용으로 검색되고 동시 발생어는 원시 문서로부터 추출된다. 결과적으로 색인어는 계산된 상호 정보들을 사용함으로써 그들의 세맨틱에 의해 클러스팅된다. 이 논문은 재현율의 감소없이 클라이언트 사용자 모듈로부터 피드백에 따라 세분된 세맨틱 정보를 사용하여 부적절한 검색 결과를 거절함으로써 검색 효율을 높일 수 있도록 설계하였다.

  • PDF

정보 검색 기술을 이용한 대규모 이질적인 XML 문서에 대한 효율적인 선형 경로 질의 처리 (Efficient Linear Path Query Processing using Information Retrieval Techniques for Large-Scale Heterogeneous XML Documents)

  • 박영호;한욱신;황규영
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제31권5호
    • /
    • pp.540-552
    • /
    • 2004
  • 본 논문에서는 대규모 이질 XML 문서들에 대한 부분 매치 질의를 효과적으로 처리하는 새로운 방법 XIR-Linear를 제안한다. XPath 질의는 XML 문서를 표현하는 트리 구조에 대한 경로 표현식 (path expression)으로 쓰여진다. 주요한 형태의 XPath 질의는 부분 매치 질의(partial match query)이다. XIR-Linear의 목적은 이질적인 스키마들을 가진 대규모 문서들에 대한 부분 매치 질의를 효과적으로 지원하는 것이다. XIR-Linear는 관계형 테이블을 이용한 스키마-레벨 방법에 기반을 두고, 역 인덱스 (inverted index) 기술을 사용하여 XPath 질의 처리의 효율성을 획기적으로 향상시킨다. 본 방법은 레이블 경로(label path)를 덱스트로 간주하고 레이블 경로 내의 레이블(label)들을 텍스트 내에 있는 키워드(keyword)로 간주한 후, 레이블들을 정보 검색 기술을 이용하여 인덱스 함으로써 전통적인 방법들에서 사용된 스트링 매치(string match) 보다 효율적인 방법으로 질의와 매치되는 레이블 경로들을 찾을 수 있도록 하였다. 성능 평가에서는 인터넷에서 수집한 XML 문서들을 사용하여 기존의 관계형 테이블을 이용하는 XRel, XParent와 비교 실험함으로써, 제안한 방법의 효율성을 입증한다. 실험을 통해 XIR-Linear가 실험 범위 내에서 XRel 이나 XParent에 비해 수십 배 이상 좋은 성능을 보이며, XML 문서 수의 증가함에 따라 더욱 우수하다는 것을 보인다.

웹 기반의 교수 지원 시스템을 위한 XML 문서의 분류 및 검색 (Classification and Retrieval of XML Document for Teacher Support System based on Web)

  • 김행곤;김지영;최문경;김성원
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2001년도 추계학술발표논문집 (하)
    • /
    • pp.1615-1618
    • /
    • 2001
  • 최근 인터넷이 급속히 성장함에 따라 웹을 기반으로 한 학습이 활발히 진행되고 있고, 또한 학교 업무의 효율화를 지원하기 위한 분야에서도 웹이 응용되고 있다. 특히 웹에서 교수를 위한 복잡한 학교 업무의 관리와 학습자료 및 업무 자료를 지원하기 위해서는 확장성과 호환성, 편의성을 가진 XML 형태의 문서가 제공되어져야 한다. 따라서 교수 업무 지원을 위해 XML 문서의 정보들을 효율적이고 정확하게 이용하기 위해 이들 문서를 적절하게 분류하고 저장, 검색하기 위한 방법이 필요하다. 본 논문에서는 XML로 작성된 교수 업무 지원 문서의 저장과 검색을 위한 선행작업으로서, 일반적인 메타 데이터와 DTD 데이터를 정의하고, 이렇게 정의된 데이터를 이용하여 패싯 검색과 구조기반 검색, 키워드 검색을 제공함으로써 사용자는 원하는 문서를 쉽게 검색한 수 있다. 따라서 이를 통해 교수 업무 지원 문서들을 웹 상에서 효율적이고 정확하게 저장하며, 사용자가 원하는 문서를 정확하고 신속하게 검색할 수 있게 하고자 한다.

  • PDF

핵심질의 클러스터와 단어 근접도를 이용한 문서 검색 정확률 향상 기법 (A Method for Precision Improvement Based on Core Query Clusters and Term Proximity)

  • 장계훈;이경순
    • 정보처리학회논문지B
    • /
    • 제17B권5호
    • /
    • pp.399-404
    • /
    • 2010
  • 본 논문에서는 상위 검색결과 문서의 정확률을 향상시키기 위하여 핵심질의 클러스터와 단어 근접도를 이용해 재순위화하는 방법을 제안한 다. 언어모델에 의한 초기 검색결과를 상위 문서에 대해 발생한 질의어휘 조합을 기반으로 문서를 클러스터링한다. 질의어휘 조합 클러스터에 대해 질의어휘 사이의 근접도를 이용하여 핵심질의 클러스터를 선택한다. 질의의 문맥정보를 이용해 핵심질의 클러스터의 문서를 재순위화한다. 뉴스집합인 TREC AP 컬렉션에 대해 언어모델과 제안한 방법의 문서 정확률을 비교한 결과 제안방법이 언어모델에 비해 상위 100개 문서(P@100)에서 11.2% 성능이 향상되었다.

효율적인 전자도서관 체제 구축을 위한 연구 (A study on the Implementation for the effective Digital Library System)

  • 류범종;강무영;조영화
    • 한국기술혁신학회:학술대회논문집
    • /
    • 한국기술혁신학회 1998년도 춘계정기학술대회
    • /
    • pp.3-3
    • /
    • 1998
  • 전자도서관체제는 일종의 전자정보생산시스템으로서 기존의 도서관 체제와는 차별화 된다. 즉, 기존의 도서관이 수요자와 직접 관계에 있는 서비스업에 가까웠다고 보면 전자도서관 체제에서의 기존 도서관은 새로운 정보(지식)를 생산 가공하는 지식 생산업체로 변모할 것이며, 외부의 지식을 끊임없이 받아들이고 재생산할 수 있는 조직체인 것이다. 이에 따라 전자도서관은 데이터 표현양식도 SGML과 같이 개방성 있는 문서 표준화 양식으로 통일해야 하며 각 사이트 전자도서관시스템이 연계되어 정보공유가 가능하도록 하여야 한다. 이를 위하여 현재 추진되고 있는 국가주요전자도서관연계사업을 통하여 효율적인 전자도서관체제 구축을 위한 기술적 방안을 제시하고자 한다.

  • PDF

XML 문서관리를 위한 데이터 모델 설계 및 성능평가 (Design and Performance Evaluation of Data Models for the XML Document Management)

  • 유재수;손충범;조혜영
    • 인터넷정보학회논문지
    • /
    • 제2권5호
    • /
    • pp.59-70
    • /
    • 2001
  • 최근 다양한 분야에서 XML이 인터넷상에서 정보교환의 표준으로 자리잡아 가고 있다. 따라서 그동안 XML 문서를 데이터베이스에 저장하고 검색하기 위한 데이터 모델링에 관한 연구가 활발히 진행되어 왔다. 그러나 기존의 연구들은 동적 환경에서 문서 변경 시 버전을 지원하면서 빠른 문서 검색을 효율적으로 지원하지 못하는 단점이 있다. 본 논문에서는 XML 저장 관리시스템에서 사용되고 있는 비분할 모델과 분할 모델의 장점들을 수용하여 동적 환경에 적합한 혼합 모델링 방법 4가지를 제안한다. 또한 시뮬레이션을 통하여 제안한 혼합형 모델링 기법의 우수성을 보인다. 이를 통해 다양한 동적 응용에 적합한 데이터 모델링을 제시하고자 한다.

  • PDF