• Title/Summary/Keyword: 데이터 구조 유사도

Search Result 548, Processing Time 0.026 seconds

An Energy-Effective Data Transmission Method using Clustering Similar Ranges (유사구간 클러스터링을 이용한 에너지 효율적인 데이터 전송방법)

  • Hong, Chang-Gi;Kim, Chang-Hwa;Lee, Seung-Jae;Kim, Sang-Kyeung
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2006.10c
    • /
    • pp.108-112
    • /
    • 2006
  • 센서 네트워크는 제한된 에너지를 가지는 작은 노드들로 구성이 된다. 이 센서 네트워크에서 가장 큰 에너지 손실을 가져오는 부분은 RF통신 부분이라 할 수 있다. 해양 센서 네트워크는 통신 매체로 음파를 사용하기 때문에 RF를 사용하는 센서 네트워크보다 통신하는데 더 많은 에너지를 소모한다. 센서 네트워크에서 통신 횟수를 줄여 에너지 효율을 높이는 방법으로 네트워크 내 집계 연산이나 필터링 등이다. 해양환경에서 데이터 값들이 유사한 층을 가지고 있다. 이 유사층에서 네트워크 내 집계 연산과 필터링의 의미를 살펴보겠다. 해양 센서 네트워크는 기존의 토플로지와 다른 구조를 가지고 있다. 새로 제안하는 구조에 어떠한 개념과 기능이 있는지를 살펴본 후 센서 노드들 임계값을 사용하여 센싱된 데이터 값이 유사한 구간을 클러스터로 묶고 묶여진 클러스터 내에서 어떻게 데이터를 전송할 방법을 제안한다.

  • PDF

Similarity Measure based on XML Document's Structure and Contents (XML 문서의 구조와 내용을 고려한 유사도 측정)

  • Kim, Woo-Saeng
    • Journal of Korea Multimedia Society
    • /
    • v.11 no.8
    • /
    • pp.1043-1050
    • /
    • 2008
  • XML has become a standard for data representation and exchange on the Internet. With a large number of XML documents on the Web, there is an increasing need to automatically process those structurally rich documents for information retrieval, document management, and data mining applications. In this paper, we propose a new method to measure the similarity between XML documents by considering their structures and contents. The similarity of document's structure is found by a simple string matching technique and that of document's contents is found by weights taking into account of the names and positions of elements. The overall algorithm runs in time that is linear in the combined size of the two documents involved in comparison evaluation.

  • PDF

Cluster Merging Using Density based Fuzzy C-Means algorithm (밀도 기반의 퍼지 C-Means 알고리즘을 이용한 클러스터 합병)

  • 한진우;전성해;오경환
    • Proceedings of the Korean Institute of Intelligent Systems Conference
    • /
    • 2003.05a
    • /
    • pp.235-238
    • /
    • 2003
  • Fuzzy C-Means(FCM) 알고리즘은 초기 군집 중심의 개수와 위치에 따라 군집 결과의 성능차이가 많이 나타난다. 하지만 일반적인 경우에 군집 중심의 개수는 분석가의 주관에 의해 결정되고, 임의적으로 결정되기 때문에 원래 데이터의 구조와는 무관하게 수행되어 최적화된 군집화 수행을 실행하지 못하는 경우가 발생하게 된다. 따라서 본 논문에서는 원래의 데이터의 구조에 좀더 근접한 퍼지 군집화를 수행하기 위하여 격자를 바탕으로 한 데이터의 밀도를 이용한 FCM을 제안하고, 이러한 밀도 기반 FCM에 의해 결정된 군집의 합병 기법을 제안하였다. N-차원의 데이터 공간을 N-차원의 격자로 나누고, 초기 군집 중심의 개수와 위치는 각 격자의 밀도를 바탕으로 결정된다. 초기화 이후에 각 격자 내부에서 FCM을 이용하여 군집화를 수행하고, 계속해서 이웃 격자의 군집결과에 대하여 군집간의 유사도 측도를 이용하여 군집 합병을 수행함으로써 데이터의 자연적인 구조에 근접한 군집화를 수행하였다. 제안된 군집화 합병 기법의 향상된 성능은 UCI Machine Learning Repository 데이터를 이용하여 확인하였다.

  • PDF

Design of Efficient Storage Exploiting Structural Similarity in Microarray Data (마이크로어레이 데이터의 구조적 유사성을 이용한 효율적인 저장 구조의 설계)

  • Yun, Jong-Han;Shin, Dong-Kyu;Shin, Dong-Il
    • The KIPS Transactions:PartD
    • /
    • v.16D no.5
    • /
    • pp.643-650
    • /
    • 2009
  • As one of typical techniques for acquiring bio-information, microarray has contributed greatly to development of bioinformatics. Although it is established as a core technology in bioinformatics, it has difficulty in sharing and storing data because data from experiments has huge and complex type. In this paper, we propose a new method which uses the feature that microarray data format in MAGE-ML, a standard format for exchanging data, has frequent structurally similar patterns. This method constructs compact database by simplifying MAGE-ML schema. In this method, Inlining techniques and newly proposed classification techniques using structural similarity of elements are used. The structure of database becomes simpler and number of table-joins is reduced, performance is enhanced using this method.

Design of an Incremental System for Reconstruction of Similar Structured XML Documents (유사구조를 갖는 XML 문서의 재구성을 위한 점진적인 시스템 설계)

  • Seol, Jin-An;Jung, Kye-Dong;Choi, Young-Keun
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2003.05b
    • /
    • pp.1031-1034
    • /
    • 2003
  • XML은 통합된 데이터 모델을 지원하기 위한 언어로, 특정 분야의 데이터에 대한 친환 및 통합의 필요성이 증대되어지고 있다. 일반적으로 데이터 교환은 다양한 공급자에 의해 독립적으로 운용 및 서비스됨으로서 개별적으로 데이터를 수집해야 하며 재배포 과정 또한 어렵다. 따라서 데이터 재배포 과정을 간소화하고 데이터 교환의 최적화를 위해 데이터 통합을 위한 재구성 방법이 필요하다. 본 논문에서는 특정 분야의 유사한 구조로 구성된 여러 문서를 입력받아 하나의 통합된 문서로 재구성할 수 있는 시스템을 제안한다. 제안된 시스템은 색인기법을 기반으로 추출된 정보를 하나의 문서로 매핑하기 위해 데이터 사전을 선계하고, 하나의 통합된 문서를 점진적인 과정을 통하여 재구성한다 따라서 재구성된 문서는 재배포 과정을 간소화할 수 있으며, 데이터 교환의 최적화는 물론 전자문서교환(EDI)에 있어서 정보교환 능력을 증가시킬 수 있다.

  • PDF

DART: Data Augmentation using Retrieval Technique (DART: 검색 모델 기술을 사용한 데이터 증강 방법론 연구)

  • Seungjun Lee;Jaehyung Seo;Jungseob Lee;Myunghoon Kang;Hyeonseok Moon;Chanjun Park;Dahyun Jung;Jaewook Lee;Kinam Park;Heuiseok Lim
    • Annual Conference on Human and Language Technology
    • /
    • 2022.10a
    • /
    • pp.313-319
    • /
    • 2022
  • 최근 BERT와 같은 트랜스포머 (Transformer) 기반의 모델이 natural language understanding (NLU)와 같은 여러 자연어 처리 태스크에서 좋은 성능을 보인다. 이러한 모델은 여전히 대용량의 학습을 요구한다. 일반적으로, 데이터 증강 기법은 low-resource 환경을 개선하는 데 도움을 준다. 최근 생성 모델을 활용해 합성 데이터를 생성해 데이터를 증강하는 시도가 이루어졌다. 이러한 방법은 원본 문장과 의미론적 유사성을 훼손하지 않으면서 어휘와 구조적 다양성을 높이는 것을 목표로 한다. 본 논문은 task-oriented 한 어휘와 구조를 고려한 데이터 증강 방법을 제안한다. 이를 위해 검색 모델과 사전 학습된 생성 모델을 활용한다. 검색 모델을 사용해 학습 데이터셋의 입력 문장과 유사한 문장 쌍을 검색 (retrieval) 한다. 검색된 유사한 문장 쌍을 사용하여 생성 모델을 학습해 합성 데이터를 생성한다. 본 논문의 방법론은 low-resource 환경에서 베이스라인 성능을 최대 4% 이상 향상할 수 있었으며, 기존의 데이터 증강 방법론보다 높은 성능 향상을 보인다.

  • PDF

A study on searching image by cluster indexing and sequential I/O (연속적 I/O와 클러스터 인덱싱 구조를 이용한 이미지 데이타 검색 연구)

  • Kim, Jin-Ok;Hwang, Dae-Joon
    • The KIPS Transactions:PartD
    • /
    • v.9D no.5
    • /
    • pp.779-788
    • /
    • 2002
  • There are many technically difficult issues in searching multimedia data such as image, video and audio because they are massive and more complex than simple text-based data. As a method of searching multimedia data, a similarity retrieval has been studied to retrieve automatically basic features of multimedia data and to make a search among data with retrieved features because exact match is not adaptable to a matrix of features of multimedia. In this paper, data clustering and its indexing are proposed as a speedy similarity-retrieval method of multimedia data. This approach clusters similar images on adjacent disk cylinders and then builds Indexes to access the clusters. To minimize the search cost, the hashing is adapted to index cluster. In addition, to reduce I/O time, the proposed searching takes just one I/O to look up the location of the cluster containing similar object and one sequential file I/O to read in this cluster. The proposed schema solves the problem of multi-dimension by using clustering and its indexing and has higher search efficiency than the content-based image retrieval that uses only clustering or indexing structure.

Designing of Comparison System for Protein Tertiary Substructure Database (단백질 3차 하위구조 비교 시스템 설계)

  • Yu, Nam Hee;Jung, Kwang Su;Sohn, Gyo Yong;Chung, Yong Je;Ryu, Keun Ho
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2009.04a
    • /
    • pp.369-371
    • /
    • 2009
  • 생명체 내에서 기능 수행 시 각종 물질들이나 단백질들끼리 상호결합을 해야 한다. 이런 결합성을 결정짓는 것들이 단백질의 3차원 구조이기 때문에 단백질 구조연구는 중요하다. 이 논문에서는 단백질 구조데이터 및 관련된 구조정보의 통합된 데이터베이스를 구축하고 웹 환경에서 질의된 단백질과 유사성 비교를 진행하여 그 결과 및 연관된 정보를 검색하여 체계적으로 정보를 제공하는 단백질 구조 비교시스템을 제안한다. 제안 시스템을 구축하기 위하여 공개용 단백질 구조데이터 저장소인 Protein Data Bank의 플랫파일에서 필수적인 구조데이터정보만을 추출하여 여기에서 단백질의 하위구조 생성 알고리즘을 적용하여 데이터베이스를 구축한다. 사용자가 인터넷을 통하여 진행한 질의는 하위구조처리 모듈을 통하여 하위구조를 생성하고 구조유사부분에 대해 RMSD값이 계산되고 이와 연관된 구조정보의 검색이 진행 된 후 체계적으로 출력화면에 보여준다. 제안 시스템은 단백질의 전체적인 서열과 구조 정보를 이용하지 않고서, 단백질 기능을 결정하는 핵심영역을 포함하는 표면을 효과적으로 비교함으로써 기존의 구조비교 시스템보다 빠른 검색과 상세한 분석을 지원한다.

Comparison and Analyzing System for Protein Tertiary Structure Database expands LOCK (LOCK을 확장한 3차원 단백질 구조비교 및 분석시스템의 설계 및 구현)

  • Jung Kwang Su;Han Yu;Park Sung Hee;Ryu Keun Ho
    • The KIPS Transactions:PartD
    • /
    • v.12D no.2 s.98
    • /
    • pp.247-258
    • /
    • 2005
  • Protein structure is highly related to its function and comparing protein structure is very important to identify structural motif, family and their function. In this paper, we construct an integrated database system which has all the protein structure data and their literature. The structure queries from the web interface are compared with the target structures in database, and the results are shown to the user for future analysis. To constructs this system, we analyze the Flat-File of Protein Data Bank. Then we select the necessary structure data and store as a new formatted data. The literature data related to these structures are stored in a relational database to query the my kinds of data easily In our structure comparison system, the structure of matched pattern and RMSD valure are calculated, then they are showed to the user with their relational documentation data. This system provides the more quick comparison and nice analyzing environment.

Development of a Prediction Model for Advertising Effects of Celebrity Models using Big data Analysis (빅데이터 분석을 통한 유명인 모델의 광고효과 예측 모형 개발)

  • Kim, Yuna;Han, Sangpil
    • Journal of the Korea Convergence Society
    • /
    • v.11 no.8
    • /
    • pp.99-106
    • /
    • 2020
  • The purpose of this study is to find out whether image similarity between celebrities and brands on social network service be a determinant to predict advertising effectiveness. To this end, an advertising effect prediction model for celebrity endorsed advertising was created and its validity was verified through a machine learning method which is a big data analysis technique. Firstly, the celebrity-brand image similarity, which was used as an independent variable, was quantified by the association network theory with social big data, and secondly a multiple regression model which used data representing advertising effects as a dependent variable was repeatedly conducted to generate an advertising effect prediction model. The accuracy of the prediction model was decided by comparing the prediction results with the survey outcomes. As for a result, it was proved that the validity of the predictive modeling of advertising effects was secured since the classification accuracy of 75%, which is a criterion for judging validity, was shown. This study suggested a new methodological alternative and direction for big data-based modeling research through celebrity-brand image similarity structure based on social network theory, and effect prediction modeling by machine learning.