• 제목/요약/키워드: 계층 클러스터링

검색결과 271건 처리시간 0.022초

OPAC에서 탐색결과의 클러스터링에 관한 연구 (The Effectiveness of Hierarchic Clustering on Query Results in OPAC)

  • 노정순
    • 한국문헌정보학회지
    • /
    • 제38권1호
    • /
    • pp.35-50
    • /
    • 2004
  • 본 연구는 한글 OPAC에서 문헌의 분류와 브라우징에 적합한 정적 계층클러스터링 모형이 서명단어 탐색으로 검색된 탐색결과를 클러스터링하는데도 효과적인지를 규명하기 위해 수행되었다. 서명에 출현하는 단어와 색인자가 부여한 통제어를 통합한 색인어를 이진빈도로 가중치를 주어, 다이스와 자카드 계수, 집단 간 평균연결과 완전연결 클러스터링 기법이 테스트되었다. 16개의 서명단어 탐색으로 검색된 문헌을 클러스터링한 결과 최적으로 선택된 클러스터의 정확률은 유사도 계수나 클러스터링 기법에 관계없이 서명단어탐색보다 100%이상 향상되었다. 1단계와 최종단계 클러스터링 모두에서, 정확률 측면에서는 완전연결이, 재현을 측면에서는 집단 간 평균연결이 더 효과적이었으나 통계적으로 유의한 수준은 아니었다. 1단계 클러스터에서 집단 간 평균연결이 보다 높은 재현율을 보인 것은 유의하였다. 다이스와 자카드 사이에 차이는 없었다. 최종클러스터가 선택되기까지 집단 간 평균연결은 너무 긴 계층군집 단계를 필요로 하여 탐색효율 측면에서 바람직해 보이지 않았다.

응용 계층 정보 기반의 에너지 효율적인 센서 네트워크 클러스터링 기법 (An Energy-Efficient Clustering Scheme based on Application Layer Data in Wireless Sensor Networks)

  • 김승목;임종현;김승훈
    • 한국멀티미디어학회논문지
    • /
    • 제12권7호
    • /
    • pp.997-1005
    • /
    • 2009
  • 본 논문에서는 계층간 설계 방식에 근거하여 에너지 효율적인 센서 네트워크 클러스터링 기법을 제안한다. 제안된 기법은 무선 센서 네트워크의 응용 환경 특성에 적합하도록 동작한다. 본 논문에서는 응용계층 정보를 이용하여 이벤트가 발생할 경우 이벤트가 발생한 지역의 센서 노드들로 구성된 클러스터와 그 이외 지역의 클러스터들로 구성하는 클러스터링 기법을 제안하였다. 제안된 클러스터링 기법에서는 여러 클러스터를 경유하여 다중 경로로 이벤트를 전달하는데 따른 에너지 소모를 절감할 수 있다. 또한 이벤트와 무관한 클러스터에서 에너지를 절약하기 위하여 각 노드 당 한 개의 슬롯만을 할당하는 TDMA 스케줄링 기법을 제안하였다. 제안하는 클러스터링 기법은 전체 네트워크의 수명을 증가시킬 수 있으며 이벤트의 발생 주기, 지속 시간, 범위에 따른 시뮬레이션을 통하여 에너지 효율성 관점에서 우수함을 입증하였다.

  • PDF

온톨로지 기반 점진적 클러스터링 기법에 관한 연구 (A Study of Incremental Clustering Technique based on Ontology)

  • 김제민;박영택
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2005년도 가을 학술발표논문집 Vol.32 No.2 (2)
    • /
    • pp.643-645
    • /
    • 2005
  • 클러스터링은 무질서한 데이터들의 상호 연관 관계를 정의하고, 이를 통하여 보다 체계적으로 데이터를 군집화하는 것이다. 클러스터링을 적용한 웹 서비스 시스템은 비슷한 내용을 묶어 제공하기 때문에 사용자는 보다 효율적으로 정보를 제공받을 수 있다. 시멘틱 웹의 기반이 되는 온톨로지는 클러스터링을 위한 완벽한 입력 데이터를 제공한다. 본 논문은 온톨로지를 기반의 메타 데이터를 클러스터링 하기 위한 기법을 제안한다. 본 논문의 목적은 온톨로지 기반의 메타 데이터들의 유사성을 측정하기 위한 평가함수를 정의하고, 이러한 평가함수를 적용한 계층적 클러스터링 알고리즘을 연구하는 것이다.

  • PDF

K-means 알고리즘을 이용한 계층적 클러스터링에서의 클러스터 계층 깊이 선택 (Selection of Cluster Hierarchy Depth in Hierarchical Clustering using K-Means Algorithm)

  • 이원휘;이신원;정성종;안동언
    • 대한전자공학회논문지SD
    • /
    • 제45권2호
    • /
    • pp.150-156
    • /
    • 2008
  • 정보통신의 기술이 발달하면서 정보의 양이 많아지고 사용자의 질의에 대한 검색 결과 리스트도 많이 추출되므로 빠르고 고품질의 문서 클러스터링 알고리즘이 중요한 역할을 하고 있다. 많은 논문들이 계층적 클러스터링 방법을 이용하여 좋은 성능을 보이지만 시간이 많이 소요된다. 반면 K-means 알고리즘은 시간 복잡도를 줄일 수 있는 방법이다. 본 논문에서는 계층적 클러스터링 시스템인 콘도르(Condor) 시스템에서 K-Means 알고리즘을 이용하여 효율적으로 정보 검색을 하고 검색결과를 계층적으로 볼 수 있도록 구현하였다. 이 시스템은 K-Means Algorithm을 이용하였으며 클러스터 계층 깊이와 초기값을 조절하여 더 나은 성능을 보임을 알 수 있다.

센서 네트워크를 위한 싱크 위치 기반의 적응적 클러스터링 프로토콜 (An Adaptive Clustering Protocol Based on Position of Base-Station for Sensor Networks)

  • 국중진;박영충;박병하;홍지만
    • 한국컴퓨터정보학회논문지
    • /
    • 제16권12호
    • /
    • pp.247-255
    • /
    • 2011
  • 무선 센서 네트워크에서 클러스터 기반의 계층적 라우팅 프로토콜들은 모든 노드들의 수명을 균등하게 유지하여, 센서 네트워크의 수명을 최대로 연장하는 것을 목표로 하고 있다. 본 논문에서는 싱크의 위치 변화를 고려한 적응적 클러스터링 프로토콜을 제안한다. 본 논문에서 제안하는 클러스터링 프로토콜의 특징은 클러스터 트리의 레벨에 따라 클러스터의 크기를 제한하는 대칭형 계층적 클러스터를 구성함으로써 싱크의 위치 변화에 적응적으로 대응 가능하며, 모든 클러스터의 생존 시간을 향상시킴과 동시에 균등한 생존 시간을 보장할 수 있다. 이 기법의 효율성을 입증하기 위해 기존의 대표적인 클러스터링 프로토콜들인 LEACH, EEUC와 본 논문에서 제안하는 적응적 클러스터링 프로토콜의 에너지 소비 정도를 시뮬레이션을 통해 비교하였으며, 그 결과 에너지 소비와 네트워크 수명의 균형에 대해 더 나은 성능을 얻어낼 수 있었다.

대용량 데이터 처리를 위한 하이브리드형 클러스터링 기법 (A Hybrid Clustering Technique for Processing Large Data)

  • 김만선;이상용
    • 정보처리학회논문지B
    • /
    • 제10B권1호
    • /
    • pp.33-40
    • /
    • 2003
  • 데이터 마이닝은 지식발견 과정에서 중요한 역할을 수행하며, 여러 데이터 마이닝의 알고리즘들은 특정의 목적을 위하여 선택될 수 있다. 대부분의 전통적인 계층적 클러스터링 방법은 적은 양의 데이터 집합을 처리하는데 적합하여 제한된 리소스와 부족한 효율성으로 인하여 대용량의 데이터 집합을 다루기가 곤란하다. 본 연구에서는 대용량의 데이터에 적용되어 알려지지 않은 패턴을 발견할 수 있는 하이브리드형 신경망 클러스터링 기법의 PPC(Pre-Post Clustrering) 기법을 제안한다. PPC 기법은 인공지능적 방법인 자기조직화지도(SOM)와 통계적 방법인 계층적 클러스터링을 결합하여 두 과정에서는 군집의 내부적 특징을 나타내는 응집거리와 군집간의 외부적 거리를 나타내는 인접거리에 따라 유사도를 측정한다. 최종적으로 PPC 기법은 측정된 유사도를 이용하여 대용량 데이터 집합을 군집화한다. PPC 기법은 UCI Repository 데이터를 이용하여 실험해 본 결과, 다른 클러스터링 기법들 보다 우수한 응집도를 보였다.

복합명사 분리 색인 방법이 문서 클러스터링에 미치는 영향 분석 (An Analysis of the Hierarchical Agglomerative Clustering based on various Compound Noun Indexing Method)

  • 양명석;최성필
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2002년도 가을 학술발표논문집 Vol.29 No.2 (2)
    • /
    • pp.697-699
    • /
    • 2002
  • 본 논문에서는 복합명사에 대한 색인 방법을 다각적으로 적용하여 계층적 결함 문서 클러스터링 시스템의 결과를 분석하고자 한다. 우선 한글 색인 엔진과 HAC(Hierarchical Agglumerative Clustering) 엔진에 대해서 설명하고 한글 색인엔진에서 제공되는 세가지 복합명사 분석 모드에 대해서 설명한다. 또한 구현된 클러스터링 엔진의 특징과 속도 향상을 위한 기법 등을 설명한다. 실험에서는 다양한 요소를 가지고 클러스터링된 문서 집합에 대한 분석 결과를 보인다. 실험 결과에 대한 분석에서 복합명사에 대한 색인 방법이 문서 클러스터링의 결과에 직접적인 영향을 준다는 것을 보여준다.

  • PDF

계층적 문서 클러스터링을 위한 응집식 기법과 분할식 기법의 비교 연구 (A Comparative Study on the Agglomerative and Divisive Methods for Hierarchical Document Clustering)

  • 이재윤;정진아
    • 한국정보관리학회:학술대회논문집
    • /
    • 한국정보관리학회 2005년도 제12회 학술대회 논문집
    • /
    • pp.65-70
    • /
    • 2005
  • 계층적 문서 클러스터링에 있어서 실험집단에 따라 응집식 기법과 분할식 기법의 성능이 다르며, 이를 좌우하는 요소는 분류의 깊이, 즉 분류수준이라고 가정하였다. 조금만 나누면 되는 대분류인 경우는 상대적으로 분할식 기법이 유리하고, 조금만 합치면 되는 소분류인 경우에는 응집식 기법이 유리할 것이라고 판단했기 때문이다. 그에 따라 분할식 클러스터링 기법인 양분(Bisecting) K-means기법과 응집식 기법인 완전연결, 평균연결, WARD기법의 성능을 실험집단이 대분류인 경우와 소분류인 경우의 유사계수를 적용하여 각 기법별 성능을 비교하여 실험집단의 특성에 따른 적합 클러스터링 기법을 찾고자 하였다. 실험결과 응집식 기법과 분할식 기법의 성능 우열에 영향을 미치는 것은 분류수준보다는 변이계수로 측정된 상대적인 군집의 크기 편차인 것으로 나타났다.

  • PDF

계층적 클러스터링과 Gaussian Mixture Model을 이용한 뉴로-퍼지 모델링 (A Neuro-Fuzzy Modeling using the Hierarchical Clustering and Gaussian Mixture Model)

  • 김승석;곽근창;유정웅;전명근
    • 한국지능시스템학회논문지
    • /
    • 제13권5호
    • /
    • pp.512-519
    • /
    • 2003
  • 본 논문에서는 계층적 클러스터링과 GMM을 순차적으로 이용하여 최적의 파라미터를 추정하고 이를 뉴로-퍼지 모델의 초기 파리미터로 사용하여 모델의 성능 개선을 제안한다. 반복적인 시도 중 가장 좋은 파라미터를 선택하는 기존의 알고리즘 과 달리 계층적 클러스터링은 데이터들 간의 유클리디언 거리를 이용하여 클러스터를 생성하므로 반복적인 시도가 불필요하다. 또한 클러스터링 방법에 의해 퍼지 모델링을 행하므로 클러스터와 동일한 갯수의 적은 규칙을 갖는다. 제안된 방법의 유용함을 비선형 데이터인 Box-Jenkins의 가스로 예측 문제와 Sugeno의 비선형 시스템에 적용하여 이전의 연구보다 적은 규칙으로도 성능이 개선되는 것을 보였다.

의미 있는 태그 클러스터 구축을 위한 설계 방안 (A Design of Building a Meaningful Tag Cluster)

  • 박병재;우종우
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2008년도 추계학술발표대회
    • /
    • pp.658-661
    • /
    • 2008
  • 태깅은 웹 2.0의 핵심 기술 중 하나로, 매우 유연하고 역동적인 분류 체계를 제공한다. 하지만 유연성과 역동성의 확보에 의해 계층 구조나 연관 관계와 같은 태그의 관계성이 부족하거나 존재하지 않는 한계점을 가지고 있는 것 또한 사실이다. 이런 한계점을 보완하기 위한 방법으로 계층 관계를 형성하기 위한 계층 클러스터링 방법과, 연관 관계를 형성하기 위한 협업 필터링 방법이 존재한다. 이 두 가지 방법은 태그의 관계성을 제공하지만, 연관 관계와 계층 관계 중 하나만 제공한다는 단점을 가진다. 본 논문에서는 태그 검색 시 연관 관계뿐 아니라 계층 구조의 탐색을 제공해주기 위한 태그 클러스터링 알고리즘을 설계하였다. 제안한 알고리즘은 사용자 태그셋을 활용하여 태그의 유사성을 계산하는 방법을 제시하고, 기존의 시각화 방법(태그 구름)과 다른 새로운 형태로 시각화 할 수 있는 결과 데이터를 제공한다.