• 제목/요약/키워드: 질의클러스터링

검색결과 154건 처리시간 0.03초

질의어 확장에 기반을 둔 클러스터링 및 필터링 문서의 검색효율 제고에 관한 연구 (A Study on the Improvement of Retrieval Effectiveness to Clustered and Filtered Document through Query Expansion)

  • 노동조
    • 한국비블리아학회지
    • /
    • 제14권1호
    • /
    • pp.219-230
    • /
    • 2003
  • 인터넷을 비롯한 대다수의 정보검색에서 사용자가 느끼는 공통된 어려움중의 하나는 검색결과가 너무 많다는 것이다. 본 연구는 검색결과를 줄이는 방법의 하나로써 검색 문헌에 대한 정제 방법에 대하여 논의한 것이다. 궁극적으로 종전의 검색시스템에서 제대로 고려하지 않은 개념망을 통한 질의어 확장과 확장 질의어와 전처리된 문서와의 유사도 측정을 통한 문서의 선택, 백과사전 정보에 의한 의미 확장과 클러스터링, 필터링 기법 등이 정보검색의 효율을 향상시키는데 효과적인 방안임을 제안한다.

  • PDF

클러스터링 환경에서 효율적인 공간 질의 처리를 위한 로드 밸런싱 기법의 설계 및 구현 (Design and Implementation of Load Balancing Method for Efficient Spatial Query Processing in Clustering Environment)

  • 김종훈;이찬구;정현민;정미영;배영호
    • 한국멀티미디어학회논문지
    • /
    • 제6권3호
    • /
    • pp.384-396
    • /
    • 2003
  • 웹 GIS에서 인터넷 서비스 이용자의 집중 현상으로 발생하는 서버의 과부하 현상을 막기 위한 대표적인 방법으로 클라이언트와 서버가 모두 질의에 참여하는 하이브리드(Hybrid) 질의 처리 방식이 있다. 그러나 하이브리드 질의 처리 방식은 서버 확장에 제약이 존재하기 때문에 근본적인 해결책이 되지 못한다. 따라서 웹 GIS 서버의 안정적인 서비스 제공을 위해서는 웹 클러스터링 기술의 도입이 필요하다. 본 논문에서는 웹 GIS클러스터링 시스템을 위한 질의 영역의 인접성을 이용한 로드 밸런싱 기법을 제안한다. 제안하는 기법은 공간 데이터를 관리하는 타일을 기반으로 인접한 타일 그룹을 생성하여 각 서버에 할당하며, 질의 영역 및 공간 연산을 고려하여 서버에서 질의가 처리되는 동안 버퍼 재사용율이 최대가 되도록 클라이언트의 질의 요청을 서버에 전달한다. 제안하는 기법은 서버의 버퍼를 공간 인덱스 탐색에 최적화함으로써 서버의 버퍼 재사용율을 높이고, 클러스터링 시스템에서 디스크의 접근 횟수를 낮추어 전체적인 서버 시스템의 처리 능력을 향상시킨다.

  • PDF

질의패턴에 따른 다차원 파일구조의 구성방법 (Organization of Multidimensional File Structures Defending on a Query Pattern)

  • 이정아;이종학
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2007년도 춘계학술발표대회
    • /
    • pp.97-100
    • /
    • 2007
  • 본 논문에서는 다차원 파일구조를 주어진 질의 패턴에 의해 최적으로 구성할 수 있는 방법을 제시한다. 지금까지의 다차원 파일구조는 응용 시스템에서 주어지는 질의의 패턴을 고려하지 않고 다차원 파일구조를 구성하는 애트리뷰트들의 클러스터링 정도를 동일하게 취급하였다. 그러나 다차원 파일구조를 이용하는 대부분의 응용 시스템에서 구성 애트리뷰트들 사이의 액세스 정도를 크게 다르게 하는 질의 패턴을 보인다. 따라서 본 논문에서는 다차원 파일구조의 응용 시스템에서 주어지는 질의 정보를 이용하여 각 구성 애트리뷰트들 사이의 클러스터링 정도를 각각 다르게 반영함으로써 최적이 되는 다차원 파일구조를 구성하는 방안을 제시한다. 먼저 질의처리의 성능이 질의 패턴에 주어진 질의 영역의 모양과 다차원 파일구조의 도메인 공간의 분할 상태를 나타내는 페이지 영역의 모양 사이의 유사성에 따라 크게 영향 받음을 보이고, 이러한 특성을 이용하여 수학적 분석을 통하여 제안된 기법의 이론적인 배경을 증명한다.

다차원 색인구조를 이용한 객체지향 데이터베이스의 조율 가능한 클래스 계층 색인기법 (A Tunalbe Class Hierarchy Index for Object -Oriented Databases using a Mulidimensional Index Structure)

  • 이종학;황규영
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제26권3호
    • /
    • pp.365-379
    • /
    • 1999
  • 본 논문에서는 객체지향 데이터베이스의 클래스 계층에 대한 색인기법으로 이차원 색인구조를 이용하여 조율 가능한 이차원 클래스 색인기법인 2D-CHI를 제안한다. 2D-CHI 에서는 색인된 속성의 키값 도메인과 클래스 식별자 도메인으로 구성된 이차원 도메인상의 색인엔트리들에 대한 클러스터링 문제를 다룬다. 클러스터링 특성이 하나의 속성에 의해서 독점되는 B+-Tree 와 같은 일차원 색인구조를 이용하는 기존의 클래스 색인기법들은 특정 형태의 질의에 대해서만 적합한 색인기법들로서 다양한 형태의 질의들로 구성된 질의 패턴에 대해서 적절하게 대응하지 못한다. 2D-CHI에서는 질의 피턴에 따라 키값 도메인과 클래스 식별자 도메인 사이에서 색이 엔트리들의 클러스터링 정도를 조정함으로써 질의처리의 성능을 향상시킨다. 2D-CHI 의 성능평가를 위하여, 먼저 데이터의 균일 분포를 가정으로 비용 모델을 정립하여 기존의 색인기법들과 색인의 성능을 비교한다. 그리고, 계층 그리드 파일을 이용하여 구현한 2D-CHI의 실험으로 비용 모델을 검증하며, 다양한 실험을 통하여 데이터의 분포와 주어진 질의 형태에 따라 최적의 이차원 클래스 계층 색인구조를 구성할 수 있음을 보인다.

클러스터링을 이용한 R-Trees 구축방법 (R-Trees construction using clustering)

  • 차정숙;이기준
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1999년도 가을 학술발표논문집 Vol.26 No.2 (1)
    • /
    • pp.171-173
    • /
    • 1999
  • 공간 데이터베이스에서 사용되는 데이터는 그 양이 방대하고 복잡하여 이를 효율적으로 저장, 관리하는 색인이 필요하다. 여러 공간 색인 방법들 중에서 R-tree는 삽입과 삭제가 빈번히 발생하는 동적인 환경에서 효율적인 질의 성능을 보이는 것으로 알려져 있다. R-tree는 삽입되는 데이터의 순서에 따라 트리의 구조가 달라질 수 있는데, 주어진 데이터가 수정이 자주 발생하지 않는다며 데이터 입력 순서를 결정하여 질의 성능이 가장 좋은 트리를 구성할 수 있다. 본 논문에서는 데이터가 자주 수정되지 않는 환경에서 노드간의 중첩을 가장 최소화 할 수 있는 데이터 입력 순서를 결정하기 위해 클러스터링을 이용한 새로운 방법인 CSR-tree를 제안하고자 한다. CSR-tree는 일반 R-tree와 hilbert packed R-tree 방법보다 향상된 질의 성능을 보인다.

  • PDF

클러스터링 데이터베이스에서 온라인 확장을 고려한 $CSB^+$ 트리 색인의 온라인 재구성 기법 (Online Scaling Consious Online Reorganization of $CSB^+$ tree Index in a Database Cluster)

  • 심태정;이충호;이순조;배해영
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2002년도 봄 학술발표논문집 Vol.29 No.1 (B)
    • /
    • pp.196-198
    • /
    • 2002
  • 클러스터링 데이터베이스는 높은 가용성과 확장성을 갖으며, 예상치 못한 클라이언트 질의의 증가나 질의 패턴의 변경에 따른 작업부하의 편중에 효율적으로 대처할 수 있는 구조이다. 특히 온라인 확장 기법은 트랜잭션 처리를 중지하지 않고 새로운 노드를 클러스터에 추가하여 데이터를 재구성함으로써 임의의 노드에 질의가 집중되는 문제를 해결할 수 있다. 정적으로 구성된 시스템만으로는 두 대 이상의 서버에 작업량이 집중될 경우 재배치 시 서버 간의 데이터 이동의 반복 현상이 발생되며. 이로 인해 네트웍의 부하와 함께 실시간 트랜적션의 처리에 있어서 응답 시간이 지연되는 문제점이 발생한다. 따라서 본 논문에서는 데이터 이동의 반복 현상을 해결하기 위해 클러스터링 데이터베이스에서 온라인 확장을 고려한 CSB+ 트리 색인의 온라인 재구성 기법을 제안한다. 제안된 기법은 온라인 확장을 통한 동구 노드의 확장으로 데이터 이동의 반복을 막고 새롭게 추가된 노드를 통해 빠르고 효율적인 데이터의 분산을 수행한다 또한 각 시스템의 내부를 CS$B^{+}$ 트리로 구성하여 데이터의 재주성시에도 실시간 트랜잭션에 대한 빠른 응답 시간을 보장한다.

  • PDF

다차원 공간의 효율적인 그리드 분할을 통한 디클러스터링 알고리즘 성능향상 기법 (Performance Improvement of Declustering Algorithm by Efficient Grid-Partitioning Multi-Dimensional Space)

  • 김학철
    • 한국공간정보시스템학회 논문지
    • /
    • 제12권1호
    • /
    • pp.37-48
    • /
    • 2010
  • 본 논문에서는 그리드 분할과 매핑함수에 기반하여 영역질의 성능향상을 위해서 기존에 제시된 디클러스터링 방법들을 다차원 공간에 대해서 적용할 때의 문제점을 분석하고 해결법을 제시한다. 다차원 공간에 대해서 기존에 제시된 방법들을 적용할 때의 문제점은 각 차원의 분할 횟수가 적고(대부분 이진 분할이 발생함) 극히 작은 선택률에 대해서도 영역질의 각 차원의 길이가 커지기 때문에 발생한다. 본 논문에서는 이를 해결하기 위하여 다차원 공간의 다양한 그리드 분할방법에 대해서 수학적으로 성능을 예측하는 모델을 제시한다. 제시한 수학 모델을 이용하여 가능한 다양한 그리드 분할 방법들 가운데 영역질의와 겹치는 그리드 셀의 수를 감소시키는 분할 방법을 선택할 수 있으며, 이는 디클러스터링 알고리즘의 전체 성능향상으로 귀결된다. 다양한 실험결과, 본 논문에서 제시한 분할 방법을 적용할 때, 기존에 제시된 디클러스터링 알고리즘의 성능을 최대 2.7배까지 향상시킬 수 있음을 알 수 있었다.

하이브리드 P2P를 위한 관심분야 기반 클러스터링 (Interest Based Clustering Mechanism for Hybrid P2P)

  • 이이섭
    • 한국시뮬레이션학회논문지
    • /
    • 제15권1호
    • /
    • pp.69-75
    • /
    • 2006
  • 최근 P2P서비스는 인터넷 통신량의 50%를 넘게 차지하고 있다. 순수 P2P 기반 모델의 질의 메커니즘이 메시지 범람을 사용하기 때문에 대규모의 질의 패킷이 생성되기 때문이다. 본 연구에서는 순수 P2P 모델과 복합 P2P모델에서 생성되는 질의 패킷의 수를 분석하였다. 그 결과 복합 P2P모델도 메시지 범람을 발생시킨다는 것을 발견하였다. 이러한 메시지 범람을 감소시키기 위하여 본 연구에서는 복함 P2P 서비스에서의 클러스터링 메커니즘을 제안하였다. 이러한 클러스터링 알고리즘을 적용하게 되면, 약 99.998%의 메시지 범람을 감소시킬 수 있다. 제안된 알고리즘은 전에 사용되었던 슈퍼노드를 저장하므로 써 조인 연산의 비용도 절감할 수 있게 하였다.

  • PDF

고정 그리드 공간 색인을 위한 클러스터링 알고리즘의 성능 평가 (Performance Evaluation of Clustering Algorithms for Fixed-Grid Spatial Index)

  • 유진영;김진덕;김동현;홍봉희;김장수
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1998년도 가을 학술발표논문집 Vol.25 No.2 (1)
    • /
    • pp.32-134
    • /
    • 1998
  • 공간 색인의 하나인 그리드 파일은 공간 데이터 영역을 격자 형태의 셀로 분할하여 구성하는데 특히, 셀들의 크기가 모두 동일한 값으로 고정되어진 것을 고정 그리드(fixed grid)라고 한다. 셀들의 크기가 고정된으로 인해 샐 분할선 상에 객체가 존재하는 경우가 자주 발생하게 되고 이러한 객체들은 하나 이상의 셀에 의해 중복으로 참조된다. 중복 참조 객체는 1/10 시간을 증가시켜 질의 처리 시 성능 저하의 주요한 원인이 된다. 따라서 중복 객체를 효율적으로 처리 할 수 있는 클러스터링 알고리즘의 고안이 필요하다. 이 논문에서는 중복 참조 객체를 처리하기 위한 객체 클러스터링(Object clustering)과 셀 단위로 클러스터하기 위한 셀 클러스터링(Cell clustering) 알고리즘을 구현한다. 그리고 공간 질의 수행 시에 각 클러스터기법들에 대한 성능을 평가한다.

문서 클러스터링 정보를 이용한 컬렉션 융합 (Collection Fusion using Document Clustering)

  • 금기문;남세진;신동욱;김태균
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1998년도 가을 학술발표논문집 Vol.25 No.2 (2)
    • /
    • pp.147-149
    • /
    • 1998
  • 본 논문에서는 여러 정보검색 엔진들이 분산되어 있는 환경에서 이 엔진들의 검색 결과를 효과적으로 취합하여 사용자에게 제시하는 컬렉션 융합 방안을 제안하고자 한다. 이 방법은 우선 학습 질의어로 검색된 문서들의 클러스터링 정도를 이용하여 컬렉션에의 신뢰도를 측정하고 새로운 질의어가 입력되었을 때 각 컬렉션에서 검색된 문서의 유사도를 조정하여 융합하는 방법이다. 여기에서 각 컬렉션의 신뢰도는 미리 준비된 학습 질의어와 이 학습 질의어를 입력하여 검색된 문서들 사이의 유사도를 분석하여 측정한다. 이 신뢰도는 새로운 질의어가 입력되었을 때 각 컬렉션마다 문서들을 검색하고 이들 문서들을 어느 정도 신뢰할 것인가를 결정하는데 사용된다. 본 논문에서 제안한 방법은 학습과정에서 사람이 학습시킬 필요가 없는 비지도 학습에 기초하고 있다. 따라서 지금까지 지도 학습에 기초한 컬렉션 융합 방법과는 달리 인터넷과 같이 문서들이 동적으로 변하는 환경에서 쉽게 사용할 수 있다는 장점을 가진다.

  • PDF