• 제목/요약/키워드: SIMILARITY ANALYSIS

검색결과 3,168건 처리시간 0.044초

범주형 속성 기반 군집화를 위한 새로운 유사 측도 (A New Similarity Measure for Categorical Attribute-Based Clustering)

  • 김민;전주혁;우경구;김명호
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제37권2호
    • /
    • pp.71-81
    • /
    • 2010
  • 데이터의 군집을 찾아내는 문제는 패턴 인식, 이미지 처리, 시장 조사 등 많은 응용 분야에서 널리 사용되고 있다. 군집의 질을 결정하는 핵심 요소로는 유사 측도, 차원의 개수 등이 있다. 유사 측도는 데이터의 특성을 반영하여 다르게 정의되어야 하는데, 대부분 기존의 연구들은 데이터를 특징 지어주는 속성이 수치형으로 주어진 경우에 국한되어 있었다. 속성이 범주형으로 주어진 경우도 실생활에 많이 존재하지만, 범주형 변수에 대한 속성값의 유사성은 값의 순서가 고유하게 정해지지 않아서 정의하기 어렵다. 이에 더하여, 고차원 데이터에 대해서는 데이터 점들이 희박하게 위치하여 가까운 점과 먼 점간의 차이가 거의 없고, 군집화 결과가 좋지 않을 수 있다. 이 문제를 해결하기 위해 부분 차원 군집화 방법이 제안되어 왔다. 부분 차원 군집화 방법은 각 군집을 발견하기에 적합한 부분 차원을 선택하면서 군집화를 수행하는 방법이다. 본 논문에서는 범주형 속성으로 특징지어진 고차원 데이터를 부분 차원 군집화하기 위한 새로운 유사 측도를 제안한다. 유사 측도는 각 군집은 다른 군집과 구별되는 특정 정보를 잘 표현할 수 있어야 한다는 기본적인 가정 하에 속성들 사이의 상관성을 반영하여 정의되었다. 이들 모두를 반영한 유사측도는 기존에 존재하지 않았다는 점에서 본 연구는 의미가 있다. 실제 데이터 집합을 군집화하는 실험을 통해 제안하는 방법이 다른 군집화 방법보다 저차원 데이터와 고차원 데이터 모두에 대해 좀 더 정확한 군집 결과를 얻을 수 있음을 보였다.

유사성 기반 XML 문서 분석 기법 (XML Document Analysis based on Similarity)

  • 이정원;이기호
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제29권6호
    • /
    • pp.367-376
    • /
    • 2002
  • XML 문서가 가지고 있는 태그의 자유로운 정의와 내포된 구조 정보는 정보 검색 및 문서 관리 분야에 많은 이점을 제공할 수 있다. 본 논문은 XML 요소(element)의 의미와 구조 정보를 반영한 문서간의 유사성을 검사할 수 있는 XML 문서 분석 기법을 제시하고자 한다. 도출된 문서간 유사성은 많은 정보 검색 및 마이닝 등의 기초 자료로 사용될 수 있다. 먼저 XML 요소를 시소러스를 이용하여 유사어와 합성어로 구성된 확장-요소 벡터로 확장하고 유사 행렬을 구축하여 요소간 유사성을 판별한다. 또한 오토마타(NFA(Nondeterministic Finite Automata)와 DFA(Deterministic Finite Automata)(를 이용하여 XML 문서의 내포된 구조를 발견하고 최소화 한다. 요소간의 유사 행렬과 최소화된 XML 구조를 이용하여 구조간의 유사성을 판별한다. 본 논문의 XML의 의미를 반영한 유사성 분석 기법은 온라인 서점의 실제 문서의 카테고리를 인식하는 데 있어 100% 정확도를 보였다.

가사노동의 모녀간 세대전달과 관련변수 (Generational transmission of household work from mothers to married daughters and related variables)

  • 이연숙;박경은
    • 가정과삶의질연구
    • /
    • 제18권3호통권47호
    • /
    • pp.129-146
    • /
    • 2000
  • The purpose of this study was to investigation the variables that affected the generational transmission of household work form mothers to their married daughter. The subjects were 415 married daughters and their mothers living in Seoul and metropolitan areas. Statistical techniques used for this study included descriptive statistics and multiple regression analysis. The results of this study were as follows : First, married daughters; value of household work was significantly affected by total periods of marriage of daughters, daughter's perceived similarity to their mothers' household work. Second, married daughters' preference for household work was significantly affected by mother's occupation (managerialㆍprofessional), mother's perceived similarity, daughter's experience of living with mother-in-law, daughter's sex-role attitude, and daughter's perceived similarity. Third, married daughters' ability to do household work was significantly affected by total periods of marriage for mothers, mother's perceived similarity, and daughter's perceived similarity. Fourth, married daughters' standard of household work was significantly affected by mother's perceived similarity, daughter's occupation (techniciansㆍclerk), daughter's monthly income, and daughter's perceived similarity. Fifth, married daughters' usage level of home equipments was significantly affected by mother's birth order, mother's education, mother's occupation (managerialㆍprofessional), daughter's birth order, daughter's education, and daughter's monthly income. Sixth, Mother related variables had greater power than daughter related ones in explaining daughters' values and preference for household work value and preferences and usage of home equipments. In conclusion, married daughter's consciousness and performance of household work were significantly influenced by their mothers. It was especially so in daughter's usage level of hoe equipments. Accordingly, the results of this study support the existence of generational transmission of household work from mothers to their married daughters with regard to its consciousness and performance. Findings of this study have implications for counsellors, practitioners and educators.

  • PDF

의미 유사도를 활용한 Distant Supervision 기반의 트리플 생성 성능 향상 (Improving The Performance of Triple Generation Based on Distant Supervision By Using Semantic Similarity)

  • 윤희근;최수정;박성배
    • 정보과학회 논문지
    • /
    • 제43권6호
    • /
    • pp.653-661
    • /
    • 2016
  • 기존의 패턴기반 트리플 생성 시스템은 distant supervision의 가정으로 인해 오류 패턴을 생성하여 트리플 생성 시스템의 성능을 저하시키는 문제점이 있다. 이 문제점을 해결하기 위해 본 논문에서는 패턴과 프로퍼티 사이의 의미 유사도 기반의 패턴 신뢰도를 측정하여 오류 패턴을 제거하는 방법을 제안한다. 의미 유사도 측정은 비지도 학습 방법인 워드임베딩과 워드넷 기반의 어휘 의미 유사도 측정 방법을 결합하여 사용한다. 또한 한국어 패턴과 영어 프로퍼티 사이의 언어 및 어휘 불일치 문제를 해결하기 위해 정준 상관 분석과 사전 기반의 번역을 사용한다. 실험 결과에 따르면 제안한 의미 유사도 기반의 패턴 신뢰도 측정 방법이 기존의 방법보다 10% 높은 정확률의 트리플 집합을 생성하여, 트리플 생성 성능 향상을 증명하였다.

음성인식 후처리에서 음소 유사율을 이용한 오류보정에 관한 연구 (A Study on Error Correction Using Phoneme Similarity in Post-Processing of Speech Recognition)

  • 한동조;최기호
    • 한국ITS학회 논문지
    • /
    • 제6권3호
    • /
    • pp.77-86
    • /
    • 2007
  • 최근 텔레매틱스 단말기 등과 같이 음성인식을 인터페이스로 하는 음성기반 검색시스템들이 많이 개발되고 있다. 그러나 음성인식에는 여전히 많은 오류가 존재하며, 이에 오류보정에 대한 여러 가지 연구가 진행되고 있다. 본 논문에서는 한국어의 음소가 갖는 특징을 기반으로 음성인식 후처리에서의 오류보정을 제안하였다. 이를 위해 한국어 음소의 특징을 고려한 음소 유사율을 사용하였다. 음소 유사율은 훈련데이터를 모노폰으로 훈련시켜 한국어 음소 각각에 대하여 MFCC와 LPC 특징추출방법을 사용하여 특징추출을 수행하고, 바타차랴 거리 측정법을 사용하여 각 음소 사이의 유사율을 구하였다. 음소 유사율과 신뢰도를 이용하여 오류보정률을 구하였으며, 이를 사용하여 음성인식 과정에서 오류로 판명된 어절에 대하여 오류보정을 수행하고, 음절 복원과 형태소 분석을 재수행하는 과정을 거쳤다. 실험 결과 MFCC와 LPC 각각 7.5%와 5.3%의 인식 향상률을 보였다.

  • PDF

실내디자인 이미지의 유사성 측정 - 관찰자 직관 기반 측정법과 알고리즘 기반 정량적 측정법의 결과 비교를 중심으로 - (The Similarity Measurement of Interior Design Images - Comparison between Measurement based on Perceptual Judgment and Measurement through Computing the Algorithm -)

  • 유호정;하미경
    • 한국실내디자인학회논문집
    • /
    • 제24권2호
    • /
    • pp.32-41
    • /
    • 2015
  • We live in the era of unlimited design competition. As the importance of design is increasing in all areas including marketing, each country does its best effort on design development. However, the preparation on protecting interior design rights by intellectual property laws(IPLs) has not been enough even though they occupy an important place in the design field. It is not quite easy to make a judgement on the similarity between two images having a single common factor because the factors which are composed of interior design have complicated interactive relations between them. From the IPLs point of view, designs with the similar overall appearance are decided to be similar. Objective evaluation criteria not only for designers but also for design examiners and judges are required in order to protect interior design by the IPLs. The objective of this study is the analysis of the possibility that a computer algorithm method can be useful to decide the similarity of interior design images. According to this study, it is realized that the Img2 which is one of content-based image retrieval computer programs can be utilized to measure the degree of the similarity. The simulation results of three descriptors(CEDD, FCTH, JCD) in the Img2 showed the high degree of similar patterns compared with the results of perceptual judgment by observers. In particular, it was verified that the Img2 has high availability on interior design images with a high score of similarity below 60 which are perceptually judged by observers.

신뢰성 높은 동적 API 시퀀스를 이용한 소프트웨어 유사성 검사 (Software Similarity Detection Using Highly Credible Dynamic API Sequences)

  • 박성수;한환수
    • 정보과학회 논문지
    • /
    • 제43권10호
    • /
    • pp.1067-1072
    • /
    • 2016
  • 실행코드만으로 소프트웨어 간의 유사성을 비교하거나 표절을 검사하기 위해 소프트웨어만의 고유한 특징인 소프트웨어 버스마크를 이용한다. 일반적으로 소프트웨어 버스마크는 추출 방법에 따라 정적 버스마크와 동적 버스마크로 구분되고, 추출된 방법에 따라 장단점이 뚜렷하게 나타난다. 본 논문에서는 동적 분석을 이용하여 API 시퀀스 버스마크를 추출하고 실행코드 간의 유사성 검사에 이용하는 방법을 제안한다. 제안하는 동적 시퀀스 버스마크는 프로그램이 실행되는 과정에서 호출되는 모든 API 함수 및 시스템 호출을 포함하는 기존의 방법과는 다르게 실행코드 내에 정의되어 있는 API 함수만으로 구성된 API 시퀀스를 이용한다. 추출된 동적 버스마크는 프로그램의 시작에서 종료까지 호출되는 API 시퀀스이며 이를 효율적으로 비교하기 위해 서열정렬 알고리즘을 활용한 유사성 척도를 사용한다. 여러 오픈소스 소프트웨어를 비교하여 버스마크의 신뢰성과 강인성을 검증하였다. 제안하는 동적 API 시퀀스 버스마크는 실행코드의 유사성 검사에 용이하게 활용될 수 있을 것으로 기대된다.

동물 및 임상 시험의 시계열 프로파일 데이터 비교를 위한 유사성 지수 개발 (Development of a New Similarity Index to Compare Time-series Profile Data for Animal and Human Experiments)

  • 이예경;이현정;장현애;신상문
    • 품질경영학회지
    • /
    • 제49권2호
    • /
    • pp.145-159
    • /
    • 2021
  • Purpose: A statistical similarity evaluation to compare pharmacokinetics(PK) profile data between nonclinical and clinical experiments has become a significant issue on many drug development processes. This study proposes a new similarity index by considering important parameters, such as the area under the curve(AUC) and the time-series profile of various PK data. Methods: In this study, a new profile similarity index(PSI) by using the concept of a process capability index(Cp) is proposed in order to investigate the most similar animal PK profile compared to the target(i.e., Human PK profile). The proposed PSI can be calculated geometric and arithmetic means of all short term similarity indices at all time points on time-series both animal and human PK data. Designed simulation approaches are demonstrated for a verification purpose. Results: Two different simulation studies are conducted by considering three variances(i.e., small, medium, and large variances) as well as three different characteristic types(smaller the better, larger the better, nominal the best). By using the proposed PSI, the most similar animal PK profile compare to the target human PK profile can be obtained in the simulation studies. In addition, a case study represents differentiated results compare to existing simple statistical analysis methods(i.e., root mean squared error and quality loss). Conclusion: The proposed PSI can effectively estimate the level of similarity between animal, human PK profiles. By using these PSI results, we can reduce the number of animal experiments because we only focus on the significant animal representing a high PSI value.

얼굴 분석과 유사도 비교를 이용한 사용자 인증 시스템 (A User Authentication System Using Face Analysis and Similarity Comparison)

  • 류동엽;임영환;윤선희;서정민;이창훈;이근수;이상문
    • 한국멀티미디어학회논문지
    • /
    • 제8권11호
    • /
    • pp.1439-1448
    • /
    • 2005
  • 본 논문에서는 입력된 영상에서 색상 정보와 얼굴에서 주요한 특징정보의 기하 위치 분석과 추출 객체의 유사도 비교를 이용해서 얼굴 영역을 검출한 후 비율정보와 유사도를 이용해 사용자 인증을 하는 방법에 대해서 기술한다. 색상 정보를 이용한 얼굴 추출 알고리즘은 얼굴의 기울어진 정도나 크기 등에 영향을 받지 않는 장점을 가지고 있으므로 형태정보를 이용한 얼굴 추출 알고리즘에 비해 비교우위를 가진다. 하지만 색상 정보를 기반으로 하기 때문에 조명의 변화나, 피부색과 유사한 배경 등 색상에 대해 민감해서 정확한 성능을 유지하기 어렵다. 따라서 색상 정보 이외에 얼굴의 주요 특징 요소인 눈과 입술 등의 특징 정보를 검출하고 각 객체에 대한 유사도 비교를 수행함으로서 색상 정보를 이용한 방법에 비해 더 효율적으로 사용될 수 있다. 본 논문에서는 얼굴을 각각의 개체단위로 분할한 후 각 개체의 비율적인 특징을 계산하고 특정 계산식에 가중치를 부여하며 분할된 눈과 입의 유사도 검색을 통해 유사성을 확인함으로써 사용자를 인식하는 시스템을 제안한다. 제안한 방법을 실험하고 그 결과의 분석을 통해 인식률이 높아짐을 알 수 있었다.

  • PDF

길안천 저서성대형무척추동물의 군집안정성 및 유사도 분석 (Analysis of benthic macroinvertebrates community stability and similarity in the Giran stream)

  • 장명성;서을원;이종은
    • 환경생물
    • /
    • 제38권4호
    • /
    • pp.714-723
    • /
    • 2020
  • 본 연구는 길안천의 저서성대형무척추동물 군집구조를 과거와 비교하여 분석하고자, 2018년 총 2회 조사를 실시하여 Lee (2004)의 결과와 비교하였다. 2018년 출현종수는 2003년과 비교하여 총 45종이 증가하였으며, 그중 EPT 분류군이 24종, OCH 분류군이 18종이 추가로 조사되었다. 군집분석 결과, 다양도지수(H')와, 풍부도지수(R')는 증가하였고, 우점도지수(DI)는 감소하는 경향을 보였다. 섭식기능군은 주워먹는무리(GC)에 속하는 종이 과거대비 11종이 추가로 발견되어 가장 높게 나타났고, 서식기능군의 경우 붙는무리(CL)가 41종으로 가장 많은 종이 출현하였다. 군집안정성에서는 특성군 I그룹이 2003년에 57.1%, 2018년에 61.5%로 가장 높은 출현율을 보였다. 생물학적 수질평가 결과, 과거 평균 'II등급'의 수질등급과 '보통'의 환경상태에서 2018년에는 평균 'Ia'등급의 수질과 '매우 양호'한 환경상태를 나타냈다. 2018년의 이화학적 요인과 생물학적 요인과의 상관관계 분석결과, pH 및 BOD는 개체수, 우점도지수(DI), 풍부도지수(R'), 다양도지수(H'), 균등도지수(J')에 유의한 상관관계를 나타냈다. 유사도 분석결과, 각 연도별로 두 개의 유사군으로 분류되었다. 길안천 수계가 취수시설 및 생태공원, 하천정비사업을 진행하면서 발생한 물리적 교란 이후 시간이 지남에 따라 물 흐름 개선과 다양한 미소서식처 형성을 통해 종 다양성 및 풍부도가 높게 나타난 것으로 판단되며, 향후, 제한적인 구간의 하천정비공사로 인한 하상 교란과 수질과의 상관관계가 저서성대형무척추동물의 군집구조와 군집안정성에 미치는 영향에 대해 추가적인 연구가 필요할 것으로 사료된다.