• Title/Summary/Keyword: 중복 데이터

Search Result 1,018, Processing Time 0.026 seconds

Efficient and Privacy-Preserving Near-Duplicate Detection in Cloud Computing (클라우드 환경에서 검색 효율성 개선과 프라이버시를 보장하는 유사 중복 검출 기법)

  • Hahn, Changhee;Shin, Hyung June;Hur, Junbeom
    • Journal of KIISE
    • /
    • v.44 no.10
    • /
    • pp.1112-1123
    • /
    • 2017
  • As content providers further offload content-centric services to the cloud, data retrieval over the cloud typically results in many redundant items because there is a prevalent near-duplication of content on the Internet. Simply fetching all data from the cloud severely degrades efficiency in terms of resource utilization and bandwidth, and data can be encrypted by multiple content providers under different keys to preserve privacy. Thus, locating near-duplicate data in a privacy-preserving way is highly dependent on the ability to deduplicate redundant search results and returns best matches without decrypting data. To this end, we propose an efficient near-duplicate detection scheme for encrypted data in the cloud. Our scheme has the following benefits. First, a single query is enough to locate near-duplicate data even if they are encrypted under different keys of multiple content providers. Second, storage, computation and communication costs are alleviated compared to existing schemes, while achieving the same level of search accuracy. Third, scalability is significantly improved as a result of a novel and efficient two-round detection to locate near-duplicate candidates over large quantities of data in the cloud. An experimental analysis with real-world data demonstrates the applicability of the proposed scheme to a practical cloud system. Last, the proposed scheme is an average of 70.6% faster than an existing scheme.

A Novel Linkage Metric for Overlap Allowed Hierarchical Clustering (중복을 허용하는 계층적 클러스터링 기법에서 클러스터 간 유사도 평가)

  • Jeon, Joon-Woo;Song, Kwang-Ho;Kim, Yoo-Sung
    • 한국어정보학회:학술대회논문집
    • /
    • 2016.10a
    • /
    • pp.157-161
    • /
    • 2016
  • 본 논문에서는 클러스터 간의 중복을 허용한 계층적 클러스터링(hierarchical clustering) 기법에 적합한 클러스터 간 유사도 평가방법(linkage metric)을 제안하였다. 클러스터 간 유사도 평가방법은 계층적 클러스터링에서 클러스터를 통합하거나 분해하는데 쓰이며 사용된 방법에 따라 클러스터링의 결과가 다르게 형성된다. 기존의 클러스터 간 유사도 평가방법인 single linkage, complete linkage, average linkage 중 single linkage와 complete linkage는 클러스터 간 중복이 허용된 환경에서 정확도가 낮은 문제점이 있고, average linkage는 정확도가 두 방법에 비해 높지만 계산 시간 소요가 크다는 단점이 있다. 따라서 본 논문에서는 기존의 average linkage를 개선하여 중복된 데이터에 의한 필요 계산량을 크게 줄임으로써 시간적 성능이 우수한 클러스터 간 유사도 평가방법을 제안하였다. 또한, 제안된 방법을 기존 방법들과 비교실험하여 중복을 허용하는 계층적 클러스터링 환경에서 정확도는 비슷하거나 더 높고, average linkage에 비해 계산량이 감소됨을 확인하였다.

  • PDF

Improving the Lifetime of NAND Flash-based Storages by Min-hash Assisted Delta Compression Engine (MADE (Minhash-Assisted Delta Compression Engine) : 델타 압축 기반의 낸드 플래시 저장장치 내구성 향상 기법)

  • Kwon, Hyoukjun;Kim, Dohyun;Park, Jisung;Kim, Jihong
    • Journal of KIISE
    • /
    • v.42 no.9
    • /
    • pp.1078-1089
    • /
    • 2015
  • In this paper, we propose the Min-hash Assisted Delta-compression Engine(MADE) to improve the lifetime of NAND flash-based storages at the device level. MADE effectively reduces the write traffic to NAND flash through the use of a novel delta compression scheme. The delta compression performance was optimized by introducing min-hash based LSH(Locality Sensitive Hash) and efficiently combining it with our delta compression method. We also developed a delta encoding technique that has functionality equivalent to deduplication and lossless compression. The results of our experiment show that MADE reduces the amount of data written on NAND flash by up to 90%, which is better than a simple combination of deduplication and lossless compression schemes by 12% on average.

A New Sort Algorithm : Information Block Sort Algorithm(IBSA) (새로운 정렬 알고리즘 : 정보 블록 정렬 알고리즘)

  • 송태옥;김태영
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2000.10a
    • /
    • pp.560-562
    • /
    • 2000
  • 본 논문에서는 정보블록알고리즘(IBPA;Information Block Preprocessing Algorithm)을 이용한 정보블록 정렬알고리즘 (IBSA; Information Block Sort Algotithm)을 제안하고 그 성능을 평가하였다. IBSA의 시간복잡도는 O(N)이며, 데이터의 분포상태에 영향을 받지 않는다. IBPA의 성능을 측정해본 결과, 2백만개의 랜덤데이터를 정렬한 경우, 중복값 허용의 경우 (a)는 퀵 정렬의 32.42%, 기수정렬의 9%정도의 비교회수만으로도 정렬할 수 있음을 보여주었으며, 중복값이 없는 경우 (b)는 퀵 정렬의 53.12%, 기수정렬의 12.79%정도의 비교회수만으로도 정렬할 수 있음을 보여주었다.

  • PDF

Efficient Generation of 3-D Video Holograms Using Temporal-Spatial Redundancy of 3-D Moving Images (3차원 동영상의 시ㆍ공간적 정보 중복성을 이용한 효과적인 3차원 비디오 홀로그램의 생성)

  • Kim, Dong-Wook;Koo, Jung-Sik;Kim, Seung-Cheol;Kim, Eun-Soo
    • The Journal of Korean Institute of Communications and Information Sciences
    • /
    • v.37C no.10
    • /
    • pp.859-869
    • /
    • 2012
  • In this paper, a new method to efficiently generate the 3-D(three-dimensional) video holograms for 3-D moving scenes, which is called here the TSR-N-LUT method, is proposed by the combined use of temporal-spatial redundancy(TSR) of 3-D video images and novel look-up table(N-LUT) technique. That is, in the proposed scheme, with the differential pulse code modulation (DPCM) algorithm, temporally redundancy redundant data in the inter-frame of a 3-D video images are removed between the frames, and then inter-line redundant data in the inter-frame of 3-D video images are also removed by using the DPCM method between the lines. Experimental results show that the proposed method could reduced the number of calculated object points and the calculation time of one object point by 23.72% and 19.55%, respectively on the average compared to the conventional method. Good experimental results with 3-D test moving pictures finally confirmed the feasibility of the proposed method to the fast generation of CGH patterns of the 3-D video images.

Data Deduplication Method using Locality-based Chunking policy for SSD-based Server Storages (SSD 기반 서버급 스토리지를 위한 지역성 기반 청킹 정책을 이용한 데이터 중복 제거 기법)

  • Lee, Seung-Kyu;Kim, Ju-Kyeong;Kim, Deok-Hwan
    • Journal of the Institute of Electronics and Information Engineers
    • /
    • v.50 no.2
    • /
    • pp.143-151
    • /
    • 2013
  • NAND flash-based SSDs (Solid State Drive) have advantages of fast input/output performance and low power consumption so that they could be widely used as storages on tablet, desktop PC, smart-phone, and server. But, SSD has the disadvantage of wear-leveling due to increase of the number of writes. In order to improve the lifespan of the SSD, a variety of data deduplication techniques have been introduced. General fixed-size splitting method allocates fixed size of chunk without considering locality of data so that it may execute unnecessary chunking and hash key generation, and variable-size splitting method occurs excessive operation since it compares data byte-by-byte for deduplication. This paper proposes adaptive chunking method based on application locality and file name locality of written data in SSD-based server storage. The proposed method split data into 4KB or 64KB chunks adaptively according to application locality and file name locality of duplicated data so that it can reduce the overhead of chunking and hash key generation and prevent duplicated data writing. The experimental results show that the proposed method can enhance write performance, reduce power consumption and operation time compared to existing variable-size splitting method and fixed size splitting method using 4KB.

Conflict Resolution Policies and Rules for SyncML Applications (SyncML 어플리케이션에서의 데이터 충돌 해결 방안)

  • Kim, Youn-Soo;Choi, Hoon
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2003.10c
    • /
    • pp.460-462
    • /
    • 2003
  • PDA(Personal Data Assistant)나 Handheld PC와 같은 모바일 디바이스(Mobile Device)를 이용하여 주소록이나 일정관리와 같은 개인 정보를 관리하는 것이 일반적인 추세이다. 모바일 디바이스는 그 특성상 중요한 정보를 신뢰성 있는 서버와 같은 컴퓨터에 중복 저장하는 것이 필요한데, 동일한 데이터를 중복 저장하면 데이터 동기화(Data Synchronization)를 통하여 일치성을 유지하도록 해야 한다. 그러나 동기화 과정에서 데이터 충돌이 발생할 수 있다. 본 논문에서는 이러한 데이터 충돌에 대한 해결 정책을 제시하였고, 그 중 서버 우선 정책과 클라이언트 우선 정책에 필요한 해결 규칙을 설명하였다. 서버 우선 정책은 서버에 이미 존재하고 있는 값을 유지하는 것을 기본으로 하는 정책이며, 클라이언트 우선 정책은 클라이언트가 요청한 값이 우선하는 정책이다.

  • PDF

Design and Implementation of Optimal Bibliographic DB by SISAC Barcode (SISAC 바코드를 이용한 최적의 서지DB제작시스템 설계 및 구현)

  • Noh, Kyung-Ran;Kwon, Oh-Jin;Yae, Yong-Hee;Shin, Young-Ho
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2002.11c
    • /
    • pp.2293-2296
    • /
    • 2002
  • 과거 서지DB 제작시스템은 자료의 수집부터 DB제작에 이르기까지 자료입수지연 및 서지데이터입력오류, 중복레코드생성, 권호정보의 부정확한 기입, 철자오류와 관련된 많은 문제들을 내포하고 있었다. 본 연구는 이와같은 문제들을 최소화하기 위해 SISAC기반 서지DB 제작시스템을 설계 구현하였다. 이 시스템은 기존 가용자원을 최대한 활용하기 위해 SISAC 바코드를 스캐닝하여 자료의 입수처리를 신속하게 하고, 서지데이터를 입력할 때 기존에 구축된 데이터를 공유함으로써 데이터 중복입력으로 인한 시간소모적인 작업을 줄인다. 그리고 개방형 환경에서 양질의 능력을 지닌 DB제작 전문가를 선정하는데 투명성을 제공하고, 이들 DB제작전문가를 활용함으로써 데이터의 품질향상에 기여한다.

  • PDF

Design and Implementation of Korean Geospatial Data Clearinghouse (한국형 지형공간 데이타 Clearinghouse의 설계 및 구현)

  • Baek, In-Gu;Lee, Kang-Jun;Han, Ki-Joon
    • 한국공간정보시스템학회:학술대회논문집
    • /
    • 1999.06a
    • /
    • pp.131-145
    • /
    • 1999
  • 최근 정보화 사회에서 정보의 처리와 공유에 대한 관심이 크게 증가하지만 기존 지리정보시스템(GIS)이 갖고 있던 상호 이질적인 지형공간데이타 포맷을 가지고는 효율적인 정보의 처리와 공유가 어려운 형편이다. 이러한 지형공간데이타 포맷의 문제로 인해 지형공간 데이터의 중복수집의 문제가 발생하였으며, 또한 많은 시간과 경비가 중복 투자퇴고 있다. 본 논문에서는 지형공간 데이타 중복수집의 문제점을 효과적으로 해결하고, 이미 구축되어 있는 지형공간 데이타를 필요로 하는 사람들과 공유하고 유통하기 위하여 KGDC(Korean Geospatial Data Clearinghouse)를 설계 및 구현하였다. KGDC를 통하여 ESRI와 Intergraph사의 상용 지리정보시스템들의 데이타를 별도의 처리과정 없이 공유할 수 있으며, 또한 OGC(OpenGIS Consortium)의 OpenGIS 구현명세에 기술되어 있는 표준 OpenGIS 인터페이스를 지원하는 지형공간 데이타 서버의 데이타도 효과적으로 공유할 수 있다. 특히, KGDC는 다양한 검색 기능과 다양한 정보를 제공하여 손쉬운 지형공간 데이타의 공유 및 유통을 가능하게 하며, 검색을 위한 정보와 검색의 결과로 이용하기 위해 ISO/TC211 표준 메타데이타를 부분적으로 지원하고 있다.

  • PDF

Smartphone Backup System Using Deduplication Scheme (중복 제거 기술을 이용한 스마트폰 백업 시스템)

  • Jeong, Ho Min;Kim, Byung-Ki;Song, Chang-Geun;Ko, Young-Woong
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2010.11a
    • /
    • pp.1803-1806
    • /
    • 2010
  • 스마트폰에서 용량을 많이 차지하는 멀티미디어 컨텐츠, 응용 프로그램 데이터가 증가하면서 스마트폰을 위한 백업 프로그램에 대한 요구가 증가하고 있다. 본 논문에서는 중복 제거 기법을 적용한 스마트폰 백업 기술을 제안함으로 네트워크 대역폭을 효율적으로 사용하고 저장 공간을 줄일 수 있는 방안을 제시하고 있다. 제안하는 중복 제거 방식은 스마트폰에서 각 파일을 일정한 크기의 블록 단위로 분할하고 지문을 부여하고, 지문이 동일하지 않을 경우에만 데이터를 전송하는 방식을 사용한다. 실험결과 제안하는 방식이 네트워크 대역폭 및 저장 공간을 효율적으로 사용함을 보이고 있다.