• 제목/요약/키워드: search similarity

검색결과 535건 처리시간 0.032초

A Dynamic Locality Sensitive Hashing Algorithm for Efficient Security Applications

  • Mohammad Y. Khanafseh;Ola M. Surakhi
    • International Journal of Computer Science & Network Security
    • /
    • 제24권5호
    • /
    • pp.79-88
    • /
    • 2024
  • The information retrieval domain deals with the retrieval of unstructured data such as text documents. Searching documents is a main component of the modern information retrieval system. Locality Sensitive Hashing (LSH) is one of the most popular methods used in searching for documents in a high-dimensional space. The main benefit of LSH is its theoretical guarantee of query accuracy in a multi-dimensional space. More enhancement can be achieved to LSH by adding a bit to its steps. In this paper, a new Dynamic Locality Sensitive Hashing (DLSH) algorithm is proposed as an improved version of the LSH algorithm, which relies on employing the hierarchal selection of LSH parameters (number of bands, number of shingles, and number of permutation lists) based on the similarity achieved by the algorithm to optimize searching accuracy and increasing its score. Using several tampered file structures, the technique was applied, and the performance is evaluated. In some circumstances, the accuracy of matching with DLSH exceeds 95% with the optimal parameter value selected for the number of bands, the number of shingles, and the number of permutations lists of the DLSH algorithm. The result makes DLSH algorithm suitable to be applied in many critical applications that depend on accurate searching such as forensics technology.

생물정보시스템을 이용한 Local Animal BLAST Search System 구축 (Development of Local Animal BLAST Search System Using Bioinformatics Tools)

  • 김병우;이근우;김효선;노승희;이윤호;김시동;전진태;이지웅;조용민;정일정;이정규
    • Bioinformatics and Biosystems
    • /
    • 제1권2호
    • /
    • pp.99-102
    • /
    • 2006
  • BLAST(Basic Local Alignment Search Tool)는 서열 데이터베이스 탐색을 위하여 가장 많이 사용되는 프로그램이다. 전체 서열간의 최적 글로벌 정렬을 수행하는 대신에 지역적 유사성이 있는 부분을 찾아 서열 짝짓기를 수행하는 특징을 갖는다. 일반적인 연구자들은 서열 상동성 검색을 위해 NCBI에 접속하여 웹 브라우저를 통해 온라인으로 BLAST를 수행하게 되는데, 이 경우 사용자 각각의 네트워크 환경이나 입력할 데이터양에 따른 검색속도의 지연 및 제한 등과 같은 여러 문제에 부딪히게 되고, 또한 보안유지가 필요한 서열 데이터의 유출 가능성이 존재한다. 그러므로 대량의 서열 데이터에 대하여 빠르고 안전하게 BLAST 상동성 검색이 가능한 Local BLAST 검색 시스템의 필요성이 증대되고 있다. 본 연구에서는 NCBI의 Genbank에서 공개된 동물의 발현 유전자 단편들(ESTs)에 대한 데이터를 이용하여 소, 돼지, 닭, 등의 경제형질과 연관된 유용 유전자만을 추출하여 이들만으로 구성된 새로운 데이터베이스를 구축하였고, 또한 이들을 사용할 수 있는 새로운 검색시스템을 개발하였다 자체 제작한 Perl script를 사용하여 필요한 데이터를 축종별로 추출 하여 새로운 DB를 구축하였으며 이 속에는 소의 경우 650,046개, 돼지의 경우 368,120개, 닭의 경우 693,005개의 발현 유전자 단편들(ESTs)이 포함된다. 또한 이들 DB 분석이 가능한 Local Animal BLAST Web 검색시스템(http://bioinfo.kohost.net)을 고성능 병렬 PC Cluster 시스템과 연동하도록 자체 구축함으로써 본 시스템이 보다 효율적인 생물정보학 연구수행이 기여할 것으로 기대된다.

  • PDF

대용량 데이터베이스에서 다차원 인덱스를 사용한 효율적인 다단계 k-NN 검색 (Efficient Multi-Step k-NN Search Methods Using Multidimensional Indexes in Large Databases)

  • 이상훈;김범수;최미정;문양세
    • 정보과학회 논문지
    • /
    • 제42권2호
    • /
    • pp.242-254
    • /
    • 2015
  • 본 논문에서는 다차원 인덱스 기반 다단계 k-NN 검색의 성능 향상 문제를 다룬다. 기존 다단계 k-NN 검색에서는 고차원 객체의 저차원 변환으로 인한 정보 손실로 k-NN 질의 결과 매우 큰 허용치(검색 범위)가 결정되어 범위 질의 결과로 많은 후보가 검색된다. 또한, 많은 후보는 후처리 과정에서 매우 많은 I/O 및 CPU 오버헤드를 발생시킨다. 본 논문에서는 이와 같은 고찰에 기반하여 범위 질의의 허용치를 줄여 후보 개수를 줄이고 이를 통해 성능을 향상시키는 방법을 제안한다. 먼저, k-NN 질의 결과로 결정된 허용치를 고차원 및 저차원 객체간 거리 비율로 강제 축소하여 범위 질의에 사용하는 허용치 축소 (근사적) 해결책을 제안한다. 다음으로, k-NN 질의 계수 k 대신 c k 를 사용하여 얻은 보다 타이트(tight)한 허용치로 범위 질의를 수행하는 계수 제어 (정확한) 해결책을 제안한다. 실제 객체 데이터를 사용하여 실험한 결과, 제안한 두 가지 해결책은 기존 다단계 k-NN 검색에 비해 후보 개수와 검색 시간 모두를 크게 향상시킨 것으로 나타났다.

한천분해 미생물 Vibrio sp. GNUM08123의 동정 및 agarase 생산의 발효적 특성 (Identification and Characterization of Agar-degrading Vibrio sp. GNUM08123 Isolated from Marine Red Macroalgae)

  • 지원재;김윤희;김종희;홍순광
    • 한국미생물·생명공학회지
    • /
    • 제45권3호
    • /
    • pp.243-249
    • /
    • 2017
  • An agar-degrading bacterium, designated as the GNUM08123 strain, was isolated from samples of red algae collected from the Yongil Bay near East Sea, Korea. The isolated GNUM08123 strain was gram-negative, aerobic, motile, and beige-pigmented, with $C_{16:0}$ (25.9%) and summed feature 3 (comprising $C_{16:1}{\omega}7c/iso-C_{15:0}2-OH$, 34.4%) as its major cellular fatty acids. A similarity search based on the 16S rRNA gene sequence revealed that it belonged to class Gammaproteobacteria and shared 97.7% similarity with the type strain Vibrio chagasii $R-3712^T$. The DNA G+C content of strain $GNUM08123^T$ was 46.9 mol%. The major isoprenoid quinone was ubiquinone-8. The results of DNA-DNA relatedness and 16S rRNA sequence similarity analyses, in addition to its phenotypic and chemotaxonomic characteristics, suggest that strain GNUM08123 is a novel species within genus Vibrio, designated as Vibrio sp. GNUM08123. Agarase production by strain GNUM08123 was induced by agar and sucrose, but was repressed probably owing to carbon catabolite repression by glucose and maltose.

의미적 유사성에 기반한 온톨로지 선택 랭킹 모델 (Ontology Selection Ranking Model based on Semantic Similarity Approach)

  • 오선주;안중호;박진수
    • 한국전자거래학회지
    • /
    • 제14권2호
    • /
    • pp.95-116
    • /
    • 2009
  • 지식 재사용 측면에서 기존의 온톨로지를 재사용할 수 있다면 많은 자원을 절약할 수 있을 것이다. 그러나 기존의 온톨로지를 활용하기 위해서는 보다 발전된 온톨로지 검색 기능이 요구된다. 현재까지 이루어진 관련 연구들에서는 주로 렉시컬 매칭기법을 사용하여 온톨로지를 검색하였다. 그러나 의미적 측면에서 문제점이 있으므로 본 연구에서는 관계의 의미적 유사성에 기반한 온톨로지 선택 랭킹 모델을 제안한다. 본 연구는 개념간 계층 구조와 관계를 온톨로지 검색에 이용함으로써 온톨로지의 선택 랭킹을 효과적이며 실질적으로 개선하였다. 또한 실험을 통해 연구 모델의 결과와 선행 연구의 결과, 온톨로지 전문가의 랭킹 결과를 비교 분석하고 연구 모델의 타당성을 검증하였다. 본 연구 결과는 온톨로지 검색 연구를 이론적으로 발전시켰을 뿐 아니라 실무적인 측면에서 실무자들이 온톨로지를 쉽게 찾아 재사용할 수 있도록 한다.

  • PDF

Identification of Species and Sex of Korean Roe Deer (Capreolus pygargus tianschanicus) Using SRY and CYTB Genes

  • Han, Sang-Hyun;Cho, In-Cheol;Lee, Sung-Soo;Tandang, Leoncia;Lee, Hang;Oh, Hong-Shik;Kim, Byoung-Soo;Oh, Moon-You
    • Animal cells and systems
    • /
    • 제11권2호
    • /
    • pp.165-168
    • /
    • 2007
  • The nucleotide sequences of a male-specific marker sex determining region Y (SRY) gene and a mitochondrial cytochrome B (CYTB) gene were characterized and analyzed to establish a molecular method for identification of species and sex of Korean roe deer (Capreolus pygargus tianschanicus). Similarity search result of SRY sequences showed very similar result to those reported in Moose (Alces alces) and Reindeer (Rangifer tarandus), both of which had 95.9% similarity in identity. CYTB genes were very similar to those reported in Siberian roe deer (C. pygargus pygargus) which had 98.6% similarity and not to European roe deer (C. capreolus), suggesting that the DNA samples tested were of Siberian roe deer lineage. Polymerase chain reaction (PCR)-based sex typing successfully discriminated between carcasses of male and female roe deer. Males had SRY band on agarose gels and females did not. The result of this molecular sex typing provided similar information with that obtained by genital organ observation. Therefore, this molecular method using male specific marker SRY and mitochondrial CYTB genes would be very useful for identification of the species and sex of the carcass remains of roe deer.

지능형 의료영상검색시스템 HIPS 구현 (Implementation of Intelligent Medical Image Retrieval System HIPS)

  • 김종민;류갑상
    • 사물인터넷융복합논문지
    • /
    • 제2권4호
    • /
    • pp.15-20
    • /
    • 2016
  • 본 논문은 의료영상 CT 기반의 지식데이터 검색 관리시스템 구축에 대한 내용을 기술한다. 개발된 시스템은 정밀한 지능형 검색기술을 활용하여 의료영상을 판독하고 환자의 병명을 진단함으로써 병원 업무 효율성을 높이데 목적이 있다. 본 연구에서는 PACS의 의료 영상 DICOM 파일을 읽어서 영상을 처리하고, 특징 값들을 추출하여 데이터베이스에 저장한다. 진료에 필요한 새로운 의료영상을 읽어서 데이터베이스에 저장된 다른 CT의 특징 값과 비교하여 유사성을 검색하는 시스템을 구현하였다. 연구학술용으로 제공된 100장의 CT DICOM을 JPEG 파일 형태로 변환한 후, SIFT, CS-LBP, K-Mean Clustering 알고리즘을 이용하여 Code Book Library를 구축하였다. 데이터베이스 최적화를 통하여 새로운 CT 이미지에 대한 기존 데이터와의 유사성을 검색 하여 그 결과를 확인함으로써 환자의 진료 및 진단에 활용할 수 있도록 하였다.

순차패턴에 기반한 XML 문서 클러스터링 (XML Document Clustering Based on Sequential Pattern)

  • 황정희;류근호
    • 정보처리학회논문지D
    • /
    • 제10D권7호
    • /
    • pp.1093-1102
    • /
    • 2003
  • 인터넷의 사용 증가로 정보의 양은 기하급수적으로 증가하고 있으며 웹 데이터의 표준인 XML의 데이터 표현의 유연성으로 인해 EDMS(Electronic Document Management System), ebXML(e-business extensible Markup Language) 등 웹 기반의 전자문서론 이용하는 시스템들은 XML를 문서 교환 방식 및 표준 문서 형식으로 도입하고 있는 실정이다. 그러므로 점차 확산되어 가고 있는 XML 문서에 대한 효율적인 문서의 관리와 검색을 위한 연구가 필요하다. 이 논문에서는 다중 문서간의 구조적 유사성을 분류하기 위하여 엘리먼트의 순서적 의미를 갖는 XML 문서를 대상으로 순차패턴을 이용하여 문서의 특성을 반영하는 대표구조를 추출하고 추출된 구조를 기반으로 유사 구조 문서를 클러스터링하는 방법을 제시한다. 이 논문의 제안 알고리즘은 클러스터의 응집도와 클러스터간의 유사도를 함께 고려하는 비용계산 방식을 이용하므로써 클러스터링의 정확도를 높일 수 있는 효과를 얻을 수 있다.

시계열 데이타베이스에서 유사한 서브시퀀스의 모양 기반 검색 (Shape-Based Retrieval of Similar Subsequences in Time-Series Databases)

  • 윤지희;김상욱;김태훈;박상현
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제29권5호
    • /
    • pp.381-392
    • /
    • 2002
  • 본 논문에서는 시계열 데이타베이스에서의 모양 기반 검색 문제에 관하여 논의한다. 모양 기반 검색은 실제 요소 값과 관계없이 질의 시퀀스와 유사한 모양을 갖는 (서브)시퀀스를 찾는 연산이다. 본 연구에서는 모양 기반 서브시퀀스 검색을 위한 새로운 기법을 제안한다. 먼저, 시프팅, 스케일링, 이동 평균, 타임 워핑 등 변환들의 다양한 조합을 지원하는 모양 기반 검색을 위하여 새로운 유사 모델을 제시한다. 또한, 이러한 유사 모델을 기반으로 하는 모양 기반 검색을 효과적으로 처리하기 위하여 효율적인 인덱싱 및 질의 처리 기법들을 제안한다. 제안된 기법의 유용성을 규명하기 위하여 실제 데이타인 S&P 500 주식 데이터를 이용한 다양한 실험을 수행한다. 실험 결과에 의하면, 제안된 기법은 질의 시퀀스의 모양과 유사한 모양을 갖는 서브시퀀스들을 성공적으로 검색할 뿐만 아니라 순차 검색 기법과 비교하여 66배까지의 상당한 성능 개선 효과를 갖는 것으로 나타났다.

영상등록을 위한 Mutual Information 기반의 원형 템플릿 정합 (Mutual Information-based Circular Template Matching for Image Registration)

  • 예철수
    • 대한원격탐사학회지
    • /
    • 제30권5호
    • /
    • pp.547-557
    • /
    • 2014
  • 본 논문에서는 영상 등록을 위한 유사도 계산에 사용되는 원형 템플릿의 설계 방법을 제안한다. 원형 템플릿은 영상의 이동 및 회전 변환에 불변한 성질을 가지고 있어 기준 영상 및 관측 영상 사이에 이동 및 회전 변환이 존재하더라도 영상 등록 제어점을 정확하게 정합하는 장점이 있다. 기준 영상의 제어점을 중심으로 일정한 거리 이내에 다수의 원주를 구성하고 각 원주 위에 일정한 간격으로 위치하는 화소들로 이루어지는 원형 템플릿을 생성하고 이를 이차원 이산 극좌표 행렬(Discrete Polar Coordinate Matrix, DPCM)으로 구성한다. 관측 영상에서도 동일한 형태의 원형 템플릿을 생성하고 탐색 범위 내의 각 위치에서 관측 영상의 원형 템플릿을 0도에서 360도 범위 내에서 일정 각도 간격으로 회전시키면서 극좌표 행렬을 생성하고 기준 영상의 극좌표 행렬과의 유사도를 Mutual Information을 이용해서 계산한다. 탐색 범위 내의 각 위치와 회전 각도에 대한 Mutual Information이 최대가 되는 화소를 정합쌍으로 결정한다. 제안한 알고리즘은 서로 다른 두 시기에 촬영한 KOMPSAT-2 영상에 적용하여 영상의 회전 변화 조건하에서 우수한 정합 성능을 보임을 확인하였다.