• 제목/요약/키워드: Closed sequential pattern

검색결과 4건 처리시간 0.022초

효율적인 닫힌 빈발 시퀀스 마이닝 (An Efficient Mining for Closed Frequent Sequences)

  • 김형근;황환규
    • 산업기술연구
    • /
    • 제25권A호
    • /
    • pp.163-173
    • /
    • 2005
  • Recent sequential pattern mining algorithms mine all of the frequent sequences satisfying a minimum support threshold in a large database. However, when a frequent sequence becomes very long, such mining will generate an explosive number of frequent sequence, which is prohibitively expensive in time. In this paper, we proposed a novel sequential pattern algorithm using only closed frequent sequences which are small subset of very large frequent sequences. Our algorithm extends the sequence by depth-first search strategy with effective pruning. Using bitmap representation of underlying databases, we can obtain a closed frequent sequence considerably faster than the currently reported methods.

  • PDF

비트맵을 사용한 닫힌 빈발 시퀀스 마이닝 (Mining Frequent Closed Sequences using a Bitmap Representation)

  • 김형근;황환규
    • 정보처리학회논문지D
    • /
    • 제12D권6호
    • /
    • pp.807-816
    • /
    • 2005
  • 순차 패턴 탐사에 대한 연구는 대용량의 데이터베이스에서 사용자에 의해 주어지는 최소 지지도를 만족하는 빈발 시퀀스를 찾는 문제를 다룬다. 하지만 현재까지 이루어진 순차 패턴 탐사 방법은 빈발 시퀀스들의 길이가 길어지거나 최소 지지도가 상대적으로 낮게 주어진 상황에서는 생성되는 시퀀스가 기하급수적으로 많아져서 성능이 급격히 저하되는 문제점을 가지고 있다. 본 논문에서는 이 문제를 해결하기 위해서 모든 빈발 시퀀스의 정보를 포함하며 그 수가 현저히 적은 닫힌 빈발 시퀀스를 찾는 방법을 제안한다. 제안하는 알고리즘은 효율적으로 가지치기를 수행하기 위해서 깊이우선 탐색 방법으로 후보 시퀀스를 생성하고 데이터베이스를 비트맵으로 표현하여 비트 연산으로 지지도를 효율적으로 계산한다. 또한, 비트맵으로 표현된 시퀀스 특성을 이용하여 가지치기할 시퀀스를 적은 연산 비용으로 찾을 수 있다. 이런 장점을 통하여 제안한 방법이 지금까지 제안된 알고리즘보다 훨씬 빨리 닫힌 빈발 시퀀스를 찾는 것을 성능 실험을 통하여 확인하였다.

하구 환경관리를 위한 관리구역 경계 설정방안 (Defining the Boundary of Estuarine Management Zone for Estuarine Environmental Management)

  • 이강현;조현정;노백호;이창희
    • 한국해양학회지:바다
    • /
    • 제17권4호
    • /
    • pp.203-224
    • /
    • 2012
  • 실질적인 하구환경의 관리를 위해서는 관리구역, 즉 하구역이 먼저 정의되어야 한다. 그러나 하구역의 경계를 설정할 수 있는 과학적 자료의 부족으로 인해 아직까지 체계적인 경계설정 방법이 제시되지 못하고 있다. 본 연구는 하구의 물리화학적 특성 등의 과학적 자료와 더불어 지리 지형적 특성 및 이용개발 특성 등을 종합적으로 고려하여 체계적으로 하구역 경계를 설정하는 방법을 제안하였다. 하구를 하구순환의 유지여부에 따라 열린 하구와 닫힌 하구로 구분하고, 각 유형에 속한 개별 하구에 대해 물리화학, 지리지형학 및 이용개발 특성을 고려하여 하구수역의 경계를 설정한 후에 하구수역에 영향을 미치는 하구육역의 경계를 설정하는 순차적인 방법이다. 이 방법에 따라 국내 274개 하구역의 경계를 시범적으로 설정해본 결과 각 하구별로 가용한 자료의 수준과 지역 특성의 차이를 합리적으로 고려한 하구역 경계 설정이 가능한 것으로 나타났다.

베이지안 확률 및 폐쇄 순차패턴 마이닝 방식을 이용한 설명가능한 로그 이상탐지 시스템 (An Interpretable Log Anomaly System Using Bayesian Probability and Closed Sequence Pattern Mining)

  • 윤지영;신건윤;김동욱;김상수;한명묵
    • 인터넷정보학회논문지
    • /
    • 제22권2호
    • /
    • pp.77-87
    • /
    • 2021
  • 인터넷과 개인용 컴퓨터가 발달하면서 다양하고 복잡한 공격들이 등장하기 시작했다. 공격들이 복잡해짐에 따라 기존에 사용하던 시그니처 기반의 탐지 방식으로 탐지가 어려워졌으며 이를 해결하기 위해 행위기반의 탐지를 위한 로그 이상탐지에 대한 연구가 주목 받기 시작했다. 최근 로그 이상탐지에 대한 연구는 딥러닝을 활용해 순서를 학습하는 방식으로 이루어지고 있으며 좋은 성능을 보여준다. 하지만 좋은 성능에도 불구하고 판단에 대한 근거를 제공하지 못한다는 한계점을 지닌다. 판단에 대한 근거 및 설명을 제공하지 못할 경우, 데이터가 오염되거나 모델 자체에 결함이 발생해도 이를 발견하기 어렵다는 문제점을 지닌다. 결론적으로 사용자의 신뢰성을 잃게 된다. 이를 해결하기 위해 본 연구에서는 설명가능한 로그 이상탐지 시스템을 제안한다. 본 연구는 가장 먼저 로그 파싱을 진행해 로그 전처리를 수행한다. 이후 전처리된 로그들을 이용해 베이지안 확률 기반 순차 규칙추출을 진행한다. 결과적으로 "If 조건 then 결과, 사후확률(θ)" 형식의 규칙집합을 추출하며 이와 매칭될 경우 정상, 매칭되지 않을 경우, 이상행위로 판단하게 된다. 실험으로는 HDFS 로그 데이터셋을 활용했으며, 그 결과 F1score 92.7%의 성능을 나타내었다.