• 제목/요약/키워드: 군집 적합도

검색결과 336건 처리시간 0.04초

형태정보를 이용한 대역어 군집화 및 적합대역어 선정 (Translation Clustering and Adequate Translation Selection by Surface Form)

  • 구희관;정한민;이미경;성원경
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2005년도 가을 학술발표논문집 Vol.32 No.2 (2)
    • /
    • pp.532-534
    • /
    • 2005
  • 본 논문은 자동적인 언어기반자원구축을 위해 신문 말뭉치에서 괄호를 이용하여 추출한 대역어쌍들을 군집화하고 각 군집에서 적합대역어를 선정하는 방법을 제안한다. 기존 연구에서 주로 제시된 음차표기어 대역쌍 추출 방법은 완전한 형태의 영어원어 자소 정보를 이용하기 때문에 약어는 고려대상에서 제외되었다. 그러나 약어형태의 영어원어가 신문에서는 약 $82\%$를 차지하기 때문에 이를 처리할 방법이 필요하다. 따라서 본 논문에서는 바이그램을 기본으로 하는 형태정보를 이용하여 적합대역어를 선정하고 이와 형태정보를 공유하는 한국어대역어쌍들을 군집화한다. 또한, 음차표기어와 두문자어에 대한 처리를 추가하여 적용범위를 넓힌다. 실험을 위하여 신문말뭉치에서 추출한 대역어쌍 1,806개 중 영어원어를 기준으로 한국어대역어의 수가 5개 이상인 대역어쌍 집합 200개를 선정하였다. 본 논문에서 제시한 방법으로 측정한 결과, 대역어 군집화에 대해서는 $74\%$의 정확율과 $65\%$의 재현율을, 적합대역어 선정에 대해서는 $97\%$의 정확율을 보였다.

  • PDF

군집분석 기법을 이용한 공공도서관 그룹화에 대한 연구 (A Study of Library Grouping using Cluster Analysis Methods)

  • 곽철완
    • 한국비블리아학회지
    • /
    • 제31권3호
    • /
    • pp.79-99
    • /
    • 2020
  • 이 연구의 목적은 공공도서관 그룹화를 위해 적합한 군집분석 모델을 파악하고 그 특징을 분석하는데 있다. 국가도서관통계시스템의 공공도서관 통계 데이터를 사용하였으며, 군집분석 기법의 3가지 모델을 적용하였다. 공공도서관 규모를 기준으로 군집분석을 실시한 결과 크게 2가지 군집으로 구분되었으며, 군집의 크기는 크게 한쪽으로 치우쳤다. 그룹화 모델로 도서관 규모를 기준으로 삼으면, 계층적 군집분석의 와드측정법과 k-평균군집분석 모델이 적합하였다. 공공도서관 그룹화 연구 결과에 대한 시사점은 다음과 같다. 첫째, 통계 데이터 외에 도서관 서비스 관련 다양한 데이터 수집이 진행되어야 한다. 둘째, 분석 대상이 되는 데이터 세트에 적합한 분석 모델이 적용되어야 한다. 셋째, 도서관 서비스 향상을 위해 군집분석 기법의 다양한 분야 적용 가능성에 대한 적극적인 연구가 필요가 있다.

물리서식처 분석을 통한 생태 물길 복원이 다양한 군집종에 미치는 영향 (Impact on Fish Community by Restoration of Ecological Waterway using Physical Habitat Simulation)

  • 최흥식;최종근;최병웅
    • Ecology and Resilient Infrastructure
    • /
    • 제6권1호
    • /
    • pp.1-11
    • /
    • 2019
  • 본 연구는 생태 물길 복원 조성에 따른 어류 군집종에 미치는 영향을 파악하기 위하여 물리 서식처 분석을 수행하였다. 대상 어종은 피라미, 쉬리, 참갈겨니, 돌고기, 줄납자루, 밀어, 묵납자루, 꾸구리, 가는돌고기로 선정하였으며, 총 9개 어종으로 달천 내 서식하는 어류 중 95%를 차지한다. 흐름 분석은 2차원 모형인 River2D 모형을 사용하였으며, 서식처 분석은 서식처 적합도 곡선을 이용하는 서식처 적합도 모형을 사용하였다. 생태 물길 복원은 하도 내 위치한 돌보 철거 및 여울-소 구조 조성과 하상고 및 하폭의 변화를 통하여 조성하였다. 그 결과 생태 물길 복원 조성을 통하여 최적의 환경 생태 유량 조건 ($Q=7.0m^3/s$)에서 총 9종 군집종의 가중가용면적을 약 16% 향상시키는 것으로 나타났다. 이를 통하여 생태 물길 복원 조성이 하천 내 서식하는 다양한 군집종에 대하여 매우 유용한 방법임을 확인할 수 있다.

다중점 적합성 피드백방법을 이용한 영역기반 이미지 유사성 검색 (Region Based Image Similarity Search using Multi-point Relevance Feedback)

  • 김덕환;이주홍;송재원
    • 정보처리학회논문지D
    • /
    • 제13D권7호
    • /
    • pp.857-866
    • /
    • 2006
  • 질의 이미지의 시각적 특징이 사용자의 상위 수준 개념을 잘 표현하지 못하기 때문에 이미지 검색 시스템의 성능은 보통 매우 낮다. 의미적으로 유사한 이미지들이 매우 다른 시각적 특징을 보일 수도 있으며 따라서 여러 개의 군집에 분산될 수 있다. 본 논문에서는 영역기반 이미지 검색과 군집-합병을 이용한 새로운 적합성 피드백 방법을 결합한 내용기반 이미지 검색 방법을 제안한다. 주요 목표는 의미적 차이를 줄이기 위해 의미적으로 관련된 군집들을 찾는 것이다. 제안된 방법은 영역기반 군집 과정과 군집-합병 과정으로 이루어진다. 적합한 이미지들의 모든 분할된 영역들을 의미적으로 관련된 계층적인 군집으로 구성한다. 잠재된 군집의 개수를 결정하고 근접한 군집들을 합병한 후 최종 군집의 대표점들로 다중 질의를 표현한다. 군집-합병 과정에서 군집의 개수를 찾고 고차원에서 특이점 문제를 해결하기 위하여 호텔링의 $T^2$ 대신에 v개의 주성분을 이용하는 $T_v^2$를 적용하였으며 $T^2$의 성능과 $T_v^2$의 성능의 차이가 없음을 보인다. 실험 결과는 제안된 방법이 내용기반 이미지 검색 시스템의 성능을 개선하는 데 효율적임을 보여준다.

군집분석과 지역빈도해석을 이용한 확률강우량 추정에 대한 연구 (Study of Rainfall Quantile Estimation using Cluster Analysis and Regional Frequency Analysis)

  • 정영훈;정창삼;남우성;허준행
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2010년도 학술발표회
    • /
    • pp.288-291
    • /
    • 2010
  • 본 연구에서는 한강유역 109개 지점의 강우관측소에서 관측된 지속기간별 연최대강우량을 산정하고 지역빈도해석을 적용하기 위하여 한강유역에 대하여 지역구분을 실시하였다. 지역구분은 군집분석 방법인 Ward 방법, 평균연결법, Fuzzy-c means 방법, Two-Step 방법을 적용하였으며 군집분석을 수행하기 위해서 한강유역의 지점별 기상학적 인자와 지형학적 인자를 이용하여 군집분석을 수행하였다. 그 중 Fuzzy-c means 방법을 이용한 지역구분이 적합한 것으로 나타났다. 또한 모든 지속기간에 대하여 적합성 척도를 산정한 결과 GLO 분포형이 적정분포형으로 나타났으며, 지역빈도해석 방법인 지수홍수법을 이용하여 산정한 확률강우량과 지점빈도해석으로 산정한 확률강우량과 비교하여 적용성을 판단하였다.

  • PDF

붓스트랩 기법과 유전자 알고리즘을 이용한 최적 군집 수 결정 (Determination of Optimal Cluster Size Using Bootstrap and Genetic Algorithm)

  • 박민재;전성해;오경환
    • 한국지능시스템학회논문지
    • /
    • 제13권1호
    • /
    • pp.12-17
    • /
    • 2003
  • 데이터의 군집화를 수행할 때 최적 군집수 결정은 군집 결과의 성능에 많은 영향을 미친다. 특히 K-means 방법에서는 초기 군집수 K에 따라 군집결과의 성능 차이가 많이 나타난다. 하지만 대다수의 군집분석에서 초기 군집수의 결정은 경험을 바탕으로 하여 주관적으로 결정된다. 이때 개체수와 속성수가 증가하면 이러한 결정은 더욱 어려워지며 이때 결정된 군집수가 최적이 된다는 보장도 없다. 본 논문에서는 군집의 수를 자동으로 결정하고 그 결과의 유효성을 보장하기 위해 유전자 알고리즘에 기반한 최적 군집수 결정 방안을 제안한다. 데이터의 속성에 근거한 초기 해 집단이 생성되고, 해 집단 내에서 최적화된 군집수를 찾기 위해 교차 연산이 이루어진다. 적합도 값은 전체 군집화의 비 유사성의 합의 역으로 결정되어 전체적인 군집화 성능이 향상되는 방향으로 수렴된다. 또한 지역 국소값을 해결하기 위해 돌연변이 연산이 사용된다. 그리고 유전자 알고리즘의 학습 시간의 비용을 줄이기 위해 붓스트랩 기법이 적용된다

군집 주제의 유의어와 유사도를 이용한 문서군집 향상 방법 (Enhancing Document Clustering Method using Synonym of Cluster Topic and Similarity)

  • 박선;김철원
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2011년도 춘계학술발표대회
    • /
    • pp.1538-1541
    • /
    • 2011
  • 본 논문은 군집 주제의 유의어와 유사도를 이용하여 문서군집의 성능을 향상시키는 방법을 제안한다. 제안된 방법은 비음수행렬분해의 의미특징을 이용하여 군집 주제(topic)의 용어들을 선택함으로서 문서 군집 집합의 내부구조를 잘 표현할 수 있으며, 군집 주제의 용어들에 워드넷의 유의어를 사용하여서 확장함으로써 문서를 용어집합(bag-of-words)으로 표현하는 문제를 해결할 수 있다. 또한 확장된 군집 주제의 용어와 문서집합에 코사인 유사도를 이용하여서 군집의 주제에 적합한 문서를 잘 군집하여서 성능을 높일 수 있다. 실험결과 제안방법을 적용한 문서군집방법이 다른 문서군집 방법에 비하여 좋은 성능을 보인다.

원주천의 어류군집 건전화를 위한 하도의 서식구조 특성분석 (Analysis of Channel Habitat Characteristics for Soundness of Fish Community at Wonju-stream)

  • 최흥식;최준길
    • 대한토목학회논문집
    • /
    • 제29권3B호
    • /
    • pp.311-317
    • /
    • 2009
  • 원주천 수환경과 어류군의 조사연구를 기초로 하여 표본 집단 사이의 유사지수를 파악하고 UPGMA 분류법을 사용한 어류군집의 cluster분석을 실시하였다. 원주천의 상류, 중류, 하류의 복원을 위한 지표어종으로 독중개, 갈겨니, 피라미를 선택하였다. 서식환경 향상으로 하수관거의 재정비와 유역관리를 분석을 통한 갈수유량 증대와 그에 따른 수질향상을 분석하였다. 원주천 중류의 복원목표 어종으로 갈겨니를 선택하여 복합 서식적합도를 분석하였다. 갈수유량의 증가는 서식적합도 향상에 매우 중요한 것으로 나타났다. 저수로의 변경에 따른 수심과 유속의 변화가 복합서식적합도의 향상을 가져오지만 지배적인 변수는 아닌 것을 확인하였다. 갈수유량의 증가와 더불어 저수로 폭을 10%씩 줄인 결과는 초기 복합서식적합도 0.1~ 0.25에서 0.37~ 0.78로 약 3배 이상의 향상을 가져와, 이를 원주천 어류군집의 서식 적합한 하천구조 개선방안으로 제시하였다.

숫자 인식에 기반한 자동차 번호판 추출 (Car License Plate Extraction Based on Numeral Recognition)

  • 이득용;오일석
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2007년도 한국컴퓨터종합학술대회논문집 Vol.34 No.1 (C)
    • /
    • pp.407-411
    • /
    • 2007
  • 이 논문은 우리나라 차량 영상에서 번호판 영역을 추출하는 알고리즘을 제안한다. 우리나라 번호판은 하단에 네개의 숫자를 포함하고 있으므로, 네 개의 숫자를 찾으면 번호판을 추출 할 수 있다. 제안하는 방법은 입력된 영상에서 숫자의 가능성을 가진 연결 요소를 검출하고 이들을 군집화 한다. 군집화 된 연결요소들을 바탕으로 숫자 네개(4-digits) 후보를 생성한다. 4-digits 후보들을 인식하여 숫자의 가능성을 측정하고, 적합도로 변환한다. 후보영역 중 적합도가 가장 높은 영역을 번호판 영역으로 추출한다. 적합도는 Perfect Metrics 방법으로 측정하였다. 제안하는 방법을 주간 영상 4600장과 야간 영상 264장으로 테스트 한 결과 각각 97.23%, 95.45%의 검출률과 0.09%, 0.11%의 오검출률을 얻었다.

  • PDF

한강 유역에서의 강우 지역빈도 해석 방법의 비교 연구 (Comparative Study of Regional Frequency Analysis Methods of Rainfall in Han River Basin)

  • 엄명진;임승택;남우성;조원철;허준행
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2008년도 학술발표회 논문집
    • /
    • pp.1072-1076
    • /
    • 2008
  • 본 연구에서는 한강유역 109개 지점의 강우관측소에서 관측된 지속기간별 연최대강우량을 기본으로 각 지속기간별 L-모멘트값을 산정하고, 한강유역에 적합한 빈도해석기법을 정의하기 위하여 지역구분을 실시하였다. 지역구분을 위한 군집분석을 수행하기 위하여 각 지점별 기상학적 인자와 지형학적 인자를 변수로 사용하였다. 군집분석 기법인 Ward, 평균연결법, Fuzzy-c means, Two-Step방법을 이용하여 지역구분을 실시하였다. GIS를 이용하여 각 방법들을 이용하여 군집된 결과를 도시한 결과 Fuzzy-c means방법으로 구분된 지역구분이 적합한 것으로 나타났다. 또한 구분된 지역의 동질성 여부를 판단하고 적정 분포형을 선정하였으며 지점빈도해석 및 지역빈도해석을 통하여 빈도별 확률 수문량을 산정하였다. 산정된 결과의 정확도 알아보기 위해 모의발생을 시킨 후, 각 기법별로 산정된 상대 평균 제곱근 오차(Relative Root Mean Square Error, RRMSE)를 비교 분석한 결과 대체적으로 지수홍수법과 계층적 방법이 낮은 RRMSE를 나타냈다. 따라서 한강유역에서는 지수홍수법과 계층적 방법을 적용한 지역빈도해석이 적합한 것으로 판단된다.

  • PDF