• 제목/요약/키워드: longest common subsequence (LCS)

검색결과 8건 처리시간 0.031초

최장 공통 부분 서열과 극대 공통 부분 서열의 길이 비교 및 분석 (Comparison and Analysis of Lengths of Longest Common Subsequence and Maximal Common Subsequence)

  • 이동엽;나중채
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2021년도 추계학술발표대회
    • /
    • pp.15-18
    • /
    • 2021
  • 최장 공통 부분 서열(Longest Common Subsequence, LCS)은 서열 유사도(Similarity)를 측정하기 위한 주요 지표 중 하나로 특별한 가정이 없는 한 두 문자열의 LCS 를 계산하기 위해서는 두 문자열의 길이의 곱에 비례하는 시간이 필요하다. 최근 최장(longest)이라는 조건을 극대(maximal)로 완화한 극대 공통 부분 서열(Maximal Common Subsequence, MCS)이 제시되었고, 두 문자열의 MCS 를 선형에 가까운 시간에 찾는 알고리즘이 개발되었다. 극대는 최장을 보장하지 않기 때문에 두 문자열의 MCS 길이는 LCS 길이와 달리 유일하지 않을 수 있고, LCS 길이가 매우 길어도 길이가 1인 MCS가 존재할 수도 있다. 본 논문에서는 기존 알고리즘에 의해 계산되는 MCS 의 효용성을 알아보기 위해, DNA 등 여러 종류의 실제 데이터와 랜덤 생성된 데이터에 대해 LCS 와 MCS 의 길이를 비교했다. MCS 길이는 LCS 길이 대비 실제 데이터에서 32.1 ~ 60.2%, 랜덤 데이터에서는 27.5 ~ 62.9%로 나타났다. 이 비율은 문자열을 이루고 있는 알파벳 수가 많을수록, 문자열의 길이가 길어질수록 감소했다.

A Dynamic Hand Gesture Recognition System Incorporating Orientation-based Linear Extrapolation Predictor and Velocity-assisted Longest Common Subsequence Algorithm

  • Yuan, Min;Yao, Heng;Qin, Chuan;Tian, Ying
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제11권9호
    • /
    • pp.4491-4509
    • /
    • 2017
  • The present paper proposes a novel dynamic system for hand gesture recognition. The approach involved is comprised of three main steps: detection, tracking and recognition. First, the gesture contour captured by a 2D-camera is detected by combining the three-frame difference method and skin-color elliptic boundary model. Then, the trajectory of the hand gesture is extracted via a gesture-tracking algorithm based on an occlusion-direction oriented linear extrapolation predictor, where the gesture coordinate in next frame is predicted by the judgment of current occlusion direction. Finally, to overcome the interference of insignificant trajectory segments, the longest common subsequence (LCS) is employed with the aid of velocity information. Besides, to tackle the subgesture problem, i.e., some gestures may also be a part of others, the most probable gesture category is identified through comparison of the relative LCS length of each gesture, i.e., the proportion between the LCS length and the total length of each template, rather than the length of LCS for each gesture. The gesture dataset for system performance test contains digits ranged from 0 to 9, and experimental results demonstrate the robustness and effectiveness of the proposed approach.

시퀀스 기반의 유사 음악 검색 기법 (Sequence-based Similar Music Retrieval Scheme)

  • 전상훈;황인준
    • 전기전자학회논문지
    • /
    • 제13권2호
    • /
    • pp.167-174
    • /
    • 2009
  • 음악은 다양한 하위 레벨 음악 특징을 통하여 인간의 감정을 유발시키거나 음악적 무드를 만들어낸다. 보통 음악은 하나 이상의 무드로 구성되며 이것은 음악간 유사도를 결정하는 데 주요한 단서로 사용된다. 본 논문에서는 음악의 무드 변화 패턴을 기반으로 하는 새로운 음악 검색 기법을 제안한다. 이를 위해서, 우선 모든 음악에 대해 유사한 하위 레벨 특징을 가지는 세그먼트로 나누고, K-means 군집화 알고리즘을 적용하여 유사한 특징을 가지는 클러스터로 그룹화한다. 각 클러스터에 대해 유일한 무드 심볼을 정의하고 나면, 각 음악의 무드 변화 패턴은 일련의 무드 심볼 시퀀스로 표현이 가능하다. 마지막으로 음악간 유사도를 측정하기 위해서 longest common subsequence (LCS)알고리즘을 적용한다. 제안된 검색 기법의 성능을 측정하기 위해 다양한 실험과 사용자 만족도 조사를 수행하고 결과를 분석한다.

  • PDF

High-performance computing for SARS-CoV-2 RNAs clustering: a data science-based genomics approach

  • Oujja, Anas;Abid, Mohamed Riduan;Boumhidi, Jaouad;Bourhnane, Safae;Mourhir, Asmaa;Merchant, Fatima;Benhaddou, Driss
    • Genomics & Informatics
    • /
    • 제19권4호
    • /
    • pp.49.1-49.11
    • /
    • 2021
  • Nowadays, Genomic data constitutes one of the fastest growing datasets in the world. As of 2025, it is supposed to become the fourth largest source of Big Data, and thus mandating adequate high-performance computing (HPC) platform for processing. With the latest unprecedented and unpredictable mutations in severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2), the research community is in crucial need for ICT tools to process SARS-CoV-2 RNA data, e.g., by classifying it (i.e., clustering) and thus assisting in tracking virus mutations and predict future ones. In this paper, we are presenting an HPC-based SARS-CoV-2 RNAs clustering tool. We are adopting a data science approach, from data collection, through analysis, to visualization. In the analysis step, we present how our clustering approach leverages on HPC and the longest common subsequence (LCS) algorithm. The approach uses the Hadoop MapReduce programming paradigm and adapts the LCS algorithm in order to efficiently compute the length of the LCS for each pair of SARS-CoV-2 RNA sequences. The latter are extracted from the U.S. National Center for Biotechnology Information (NCBI) Virus repository. The computed LCS lengths are used to measure the dissimilarities between RNA sequences in order to work out existing clusters. In addition to that, we present a comparative study of the LCS algorithm performance based on variable workloads and different numbers of Hadoop worker nodes.

HTML 태그 순서를 이용한 불법 사이트 탐지 자동화 기술 (An Automated Technique for Illegal Site Detection using the Sequence of HTML Tags)

  • 이기룡;이희조
    • 정보과학회 논문지
    • /
    • 제43권10호
    • /
    • pp.1173-1178
    • /
    • 2016
  • 2001년 비트토렌트 프로토콜이 설계된 후로 음악, 영화, 소프트웨어 등 모든 것을 다운로드할 수 있게 되었다. 이를 통해 저작권이 있는 파일이 무분별하게 공유가 되었고 저작권자들은 많은 피해를 입었다. 이 문제를 해결하기 위해 국가에서는 관련법을 제정하였고 ISP는 불법 사이트를 차단하였다. 이러한 노력들에도 불구하고 pirate bay와 같은 불법 사이트들은 도메인을 바꾸는 등 쉽게 사이트를 재오픈하고 있다. 이에 우리는 재오픈된 불법 사이트를 쉽게 탐지하는 기술을 제안한다. 이 자동화 기술은 구글 검색엔진을 이용하여 도메인을 수집하고, 최장공통부분수열(LCS) 알고리즘을 이용하여 기존 웹페이지 태그와 검색된 웹페이지 태그를 비교, 유사도를 측정한다. 실험을 위해 총 2,383개의 검색 결과를 구글 검색으로 얻었다. LCS 유사도 알고리즘을 적용하여 검사한 결과 44개의 해적 사이트를 탐지하였다. 또한 해외 불법 사이트에 적용한 결과 805개 검색 도메인에서 23개의 불법 사이트를 탐지하였다. 이를 통해 제안된 탐지 자동화 기술을 사용한다면 불법 사이트가 재 오픈을 하더라도 쉽게 탐지할 것으로 보인다.

XML 문서의 클러스터링 기법을 이용한 스케치맵 시스템 (Sketch Map System using Clustering Method of XML Documents)

  • 김정숙;이야리;홍경표
    • 한국콘텐츠학회논문지
    • /
    • 제9권12호
    • /
    • pp.19-30
    • /
    • 2009
  • 최근 각광을 받고 있는 지도(이하 맵)를 활용한 서비스는 맵에 접근한 후 인터페이스를 통해 다양한 매쉬업 형태의 결과를 제공하는 방식이다. 이러한 서비스는 사용자에게 정확한 정보를 제공할 수는 있지만 맵의 재활용은 어렵다. 본 논문의 스케치맵 시스템은 기존의 대형 맵 시스템과는 달리 목적에 부합하는 특정 지점과 경로를 XML 문서로 표현한다. 또한, 스케치맵 간에 클러스터링 방법을 사용함으로써 맵에서 표현되는 지점을 최적의 내용으로 갱신한다. 그 결과로서, 목적지점에 대한 경로를 간단하게 약도로 표현하기 위해 설계된 맵 서비스 시스템이다. 본 시스템은 스케치 맵의 XML 문서 입력에 대하여 스케치맵 생성기에서 분석 분할 클러스터링의 과정을 통해 유효한 형태의 스케치맵을 생성한다. 스케치맵의 분할 및 병합을 위한 질의처리 방법으로는 LCS(Longest Common Subsequence) 알고리즘을 사용하였다. 또한, 본 스케치맵 시스템에 대한 기대효과를 시뮬레이션으로 제시하여 정보와 지식을 공유하는 보이는 맵들이 모여 거대한 맵을 형성함으로서 새로운 검색 포털로서의 역할을 수행할 수 있음을 보인다.

음악 무드의 변화 기반 유사 음악 검색 기법 (A Music Retrieval Scheme based on Variation of Musical Mood)

  • 전상훈;한병준;황인준
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2008년도 추계학술발표대회
    • /
    • pp.760-762
    • /
    • 2008
  • 음악에서는 다양한 감정의 표현을 시간에 따른 음악 무드의 전이로 표현한다. 본 연구에서는 Longest Common Subsequence (LCS) 알고리즘 및 k-Means 알고리즘에 기반한 유사 음악 검색 기법을 제안한다. 우선, 음악 무드의 흐름을 무드 세그먼트 단위로 나누고, 이를 추출된 다양한 음악 특성을 k-Means 알고리즘으로 분류하여 무드 시퀀스로 변환한다. 또한, 유사한 무드의 흐름을 가지는 음악을 검색하기 위해 LCS 알고리즘에 기반한 무드 시퀀스의 유사도를 정의한다. 본 논문은 제안된 내용을 바탕으로 실험과 설문 조사를 통해, 기존의 전역적 특성 검색 방식보다 시퀀스를 이용한 검색방식이 좀 더 효율적임을 증명하였다.

사용자 인터페이스의 직관적인 인식 및 일관성 부여를 위한 인터페이스 매핑 및 생성 기법 (Interface Mapping and Generation Methods for Intuitive User Interface and Consistency Provision)

  • 윤효석;우운택
    • 한국HCI학회:학술대회논문집
    • /
    • 한국HCI학회 2009년도 학술대회
    • /
    • pp.135-139
    • /
    • 2009
  • 본 논문에서는 대상기기 및 서비스의 물리적 인터페이스 영상에 기반을 둔 인터페이스인 INCUI (Intuitively Natural and Consistent User Interface)를 제시한다. 물리적 인터페이스의 영상과 XML 형식으로 기술 되는 INCUI의 개념을 소개하고, 정의된 INCUI 템플릿을 통해 사용자 인터페이스 요소간 일관성 있는 매핑을 수행하는 방법을 설명한다. 또한 INCUI 형태의 사용자 인터페이스간 매핑을 위해 도메인 크기, 소스 및 타겟 인터페이스의 유형에 따라 선택적으로 세부 매핑 알고리즘을 선택하는 새로운 매핑 구조를 제안한다. 특히 기존 문자열 기반의 LCS (Longest Common Subsequence) 알고리즘의 단점을 보완하여 접두사/접미사/동의어 정보를 활용하는 확장된 유사도 계산 알고리즘을 적용하였다.

  • PDF