• 제목/요약/키워드: 재현 정확도

검색결과 1,459건 처리시간 0.03초

등급 재현율: 이중언어 사전 구축에 대한 평가 방법 (Rated Recall: Evaluation Method for Constructing Bilingual Lexicons)

  • 서형원;권홍석;김재훈
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2013년도 제25회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.146-151
    • /
    • 2013
  • 이중언어 사전 구축 방법을 평가하는 방법에는 정확률, 재현율, MRR(Mean Reciprocal Rank) 등이 있다. 이들 방법들은 평가 집합에 있는 대역어를 정확하게 찾는 것에 초점을 맞추고 있다. 그러나 어떤 대역어가 얼마나 많이 사용되는지는 전혀 고려하지 않는다. 즉 자주 사용되는 대역어를 빨리 찾을 수 있는 방법이 좋은 방법이라고 말할 수 있다. 이와 같은 문제를 해결하기 위해서 본 논문에서는 이중언어 사전 구축의 새로운 평가 방법인 등급 재현율을 제안한다. 등급 재현율(rated recall)은 대역어가 학습 말뭉치에 나타난 정도를 반영하는 재현율이며, 자주 사용되는 대역어를 얼마나 정확하게 찾는지를 파악할 수 있는 좋은 측도이다. 본 논문에서는 문맥벡터와 중간언어를 이용한 이중언어 사전 구축 시스템의 성능을 평가하고 기존의 방법과 비교 분석하였다.

  • PDF

한글 문서의 색인어와 색인 기법

  • 강승식
    • 정보과학회지
    • /
    • 제22권4호
    • /
    • pp.72-77
    • /
    • 2004
  • 정보검색 시스템의 성능을 평가하는 요소는 재현율(recall)과 정확률(precision)이고, 재현율과 정확률을 결정하는데 가장 큰 영향을 미치는 것은 문서에 대한 색인어와 색인어 가중치이다[1]. '질의어'에 적합한 문서를 검색할 수 있는지를 결정하는 것은 "적합 문서에 대해 색인이 되어 있는가\ulcorner"하는 문제이며, 이는 재현율에 직접적인 영향을 미치게 된다. 즉, 적합 문서를 색인할 때 '질의어'에 대한 색인이 되어 있지 않은 문서는 검색이 되지 않으며, 또한 부적합 문서에 색인이 되어 있으면 부적합 문서들이 다수 검색되기 때문에 정확률이 낮아지게 된다.이 낮아지게 된다.

개수로에서의 부정류 수문곡선 재현을 위한 유량공급장치의 개발 및 정확도 분석 (Development and Accuracy Analysis of the Discharge-Supply System to Generate Hydrographs for Unsteady Flow in the Open Channel)

  • 김서준;김상혁;윤병만;지운
    • 한국수자원학회논문집
    • /
    • 제45권8호
    • /
    • pp.783-794
    • /
    • 2012
  • 시간에 따른 하도의 수위 및 유량 변화에 영향을 많이 받는 수리구조물의 설계에 있어서 부정류 흐름 해석은 반드시 필요하다. 일반적으로 부정류 흐름 해석에는 수치모형이 많이 활용되고 있으나 수치모형의 검 보정을 위한 현장 자료의 획득이 어려운 경우가 많다. 또한 자료구축이 가능하더라도 인력과 비용이 많이 소모되며, 측정 정확도를 신뢰하기 어려운 경우가 많다. 이러한 경우 수치모형의 검 보정을 위해 부정류 수리실험을 통해 획득되는 자료를 활용하는 것이 대안이 될 수 있다. 따라서 본 연구에서는 다양한 형태의 부정류 수문곡선을 실험에서 재현할 수 있는 유량공급장치를 개발하고자하며, 개발된 부정류 유량공급장치를 이용하여 수리실험 수로에서 재현되는 수문곡선과 목표 수문곡선을 비교 분석함으로써 재현 정확도를 정량적으로 평가하고자 한다. 본 연구에서는 유량이 급격하게 증가 또는 감소하는 사각형 형태, 첨두유량 발생 시간이 짧은 삼각형 형태 및 일반적인 홍수 수문곡선 형태의 종(bell) 형태 수문곡선을 대상으로 재현 오차 및 Root Mean Square Error (RMSE)를 분석하였다. 재현 정확도 분석 결과, 사각형 형태의 수문곡선 재현 오차는 약 59% 정도로 가장 크게 나타났으며, 삼각형 형태의 수문곡선은 단일첨두와 이중첨두 형태 모두 약 10% 정도의 재현 오차가 나타났지만 홍수 수문곡선 형태인 종 모양의 수문곡선의 재현 오차는 최대 2% 이내인 것으로 나타났다.

건강검진 데이터 기반 흡연자 분류를 위한 모형별 성능 분석 (Performance Evaluation between Models for Smoker Classification Based on Health Examination Data)

  • 윤지선;유헌창
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2018년도 추계학술발표대회
    • /
    • pp.648-651
    • /
    • 2018
  • 흡연여부를 감별하는 지표가 있지만 반감기 등 여러 가지 요인에 따라 결과가 변한다는 단점이 있다. 그렇기 때문에 흡연여부 감별 시 외부요인에 영향을 덜 받는 지표가 필요하게 되었다. 그래서 흡연 여부 감별하는데 적합한 모형을 찾아 외부요인에 영향이 적은 지표를 개발에 도움이 될 것을 기대하며 연구를 진행하였다. 실험은 국민건강보험공단에서 제공한 건강검진정보데이터를 기반으로, SVM, Logistic Regression, KNN 등의 머신러닝 모델을 이용하여 흡연 여부를 감별하는 것을 진행한다. 이 실험은 속성에 따른 모형의 성능변화와 학습데이터 수에 따른 모형의 성능변화에 대한 2가지 측면에서 모델의 성능을 측정하였다. 모델의 평가는 정확도(accuracy), 정밀도(precision), 재현율(recall), 조화 평균(f1-score)으로 진행하였으며, 약 70퍼센트 정도의 정확도와, 60퍼센트 대의 재현율을 보인다. 실험 결과, SVM이 속성에 따른 모형의 성능 변화 실험에서는 63%의 재현율, 학습데이터 수에 따른 성능 변화 실험에서는 68%의 재현율을 보여, 흡연자 판별에 가장 좋은 성능을 보였다. 또한 재현율을 기준으로 실험 차수별로 가장 좋은 성능을 보인 모델과 가장 저조한 성능을 보인 모델의 차이를 비교한 결과, '속성에 따른 모형의 성능 변화 실험'에서는 최고 36%의 차이를 보였으며, '학습데이터 수에 따른 성능 변화 실험'에서 최고 42%의 차이를 보여 주었다. 이에 판별을 위한 속성도 중요하지만, 적합한 모형 선택 또한 중요하다는 것을 확인하였다.

키팩트의 가중치 부여에 관한 연구 (A Study for Weight Assignments of Keyfacts)

  • 김수희;남효돈;정경택
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1999년도 가을 학술발표논문집 Vol.26 No.2 (1)
    • /
    • pp.192-194
    • /
    • 1999
  • 정보검색에서 궁극적으로 지향하는 바는 질의에 대한 정확률과 재현률을 동시에 높이는 것이다. 본 논문에서는 [중심어, 종속어]로 이루어지는 키팩트를 그 유형에 따라 9가지 형태로 분류하였으며, 이 유형들의 주요도를 반영하여 키팩트의 가중치를 계산하는 방법을 개발하였다. 키팩트 유형들에 주요도 값들을 할당한 방법을 검정하기 위한 실험은 질의문들을 이용하여 평균 정확률와 평균 재현률을 계산함으로써 수행되었다. 9개의 키팩트 타입에 6가지의 주요도 값을 할당하는 방법을 실험하였고 그 결과를 분석하였다. 본 논문의 결과는 기존의 키워드 기반 정보검색에서 문제시되고 있는 정확률을 키팩트 기반 정보 검색에서 향상할 수 있는 가능성을 시사하고 있다.

  • PDF

UAS와 지상 LiDAR 조합에 의한 수직 구조물의 3차원 공간정보 구축 (Construction of 3D Spatial Information of Vertical Structure by Combining UAS and Terrestrial LiDAR)

  • 강준오;이용창
    • 지적과 국토정보
    • /
    • 제49권2호
    • /
    • pp.57-66
    • /
    • 2019
  • 최근 스마트 시티에 의한 공간정보 제작의 일환으로 역설계를 위한 구조물의 3차원 재현이 주목받고 있다. 특히, 구조물 3차원 재현에 지상 LiDAR가 주로 사용되며 UAS에 의한 3차원 재현 연구가 활발히 진행되고 있다. 다만, 두 기술 모두 촬영각에 의한 사각지대가 발생한다. 본 연구는 수직구조물을 대상으로 UAS를 활용한 SfM기반 영상해석 기술을 통해 구현된 3D 모델과 지상 LiDAR 기반의 레이저 스캐닝에 의한 3D 모델간의 재현성 및 효용성을 검토하고 사각지대 보완을 위해 2가지 3D 모델을 조합 검토한다. 이를 위해 인공암벽을 대상으로 UAS 기반 영상을 취득하고 GNSS 장비와 토탈 스테이션을 통해 수직면 기준점(VCP) 및 점검점을 설정, SfM 기반 영상해석 기술을 활용하여 구조물의 3D 모델을 재현한다. 또한, 지상 LiDAR 스캐닝을 통해 구조물의 3D 측점 군을 취득하고 점검점을 기준으로 재현의 정확도와 3D 모델의 완성도를 UAS 기반 영상해석결과와 비교·검토하였다. 특히, UAS 및 지상 LiDAR로부터 구축한 측점 군의 조합을 통해 정확도와 실감 재현도를 확인하였다. 연구결과, 정확도 및 3D 모델 완성도에서 UAS 기반 영상해석이 우수하였고, 두 방법의 측점 군 조합으로 정확도가 향상됨을 확인하였다. UAS 및 지상 LiDAR 레이저 스캐닝 조합방법으로 수직구조물 대상 정밀 3차원 모델의 사각지대 보완·재현이 가능하므로 공간정보 구축, 안전진단 및 유지보수 관리에 효율적인 사용이 기대된다.

규칙의 일반화와 통계 방식을 결합한 한국어 문맥의존 철자오류 교정규칙의 재현율 향상 (Improving Recall for Context-Sensitive Spelling Correction Rules by Combining Rule-Generalization and Statistical Method)

  • 최현수;권혁철;윤애선
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2014년도 제26회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.18-23
    • /
    • 2014
  • 한국어 맞춤법 검사기는 전자화된 한국어 텍스트에 나타난 오류어를 검색하여 이를 교정할 대치어를 제시하는 시스템이다. 이때 오류어의 유형은 크게 단순 철자오류와 문맥의존 철자오류로 구분할 수 있다. 이중 문맥의존 철자오류는 어절(word)단위로 봤을 때는 정확하지만, 문맥을 고려하였을 때 오류가 되는 유형으로 교정 난도가 매우 높다. 문맥의존 철자오류의 교정 방법은 크게 규칙을 이용한 방법과 통계 정보에 기반을 둔 방법으로 나뉜다. 이때 규칙을 이용한 방법은 그 특성상 정확도가 매우 높지만, 반대로 재현율이 매우 낮다. 본 논문에서는 본 연구진이 기존에 연구하였던 규칙을 일반화하는 방식에 추가로 조건부 확률을 이용한 통계 방식을 결합하여 정확도를 유지하면서 재현율을 향상시키는 방법을 제안한다.

  • PDF

이중언어 코퍼스로부터 외래어 표기 사전의 자동구축 (Automatic Construction of a Transliteration Dictionary from Bilingual Corpus)

  • 이재성
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1999년도 제11회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.142-149
    • /
    • 1999
  • 외국문명의 영향으로 많은 외래어가 한국어 문서 내에서 사용되고 있으며, 이러한 단어는 주로 전문용어, 고유명사, 신조어 등으로 사전에 등록되지 않는 것이 많다. 본 논문에서는 이중언어 코퍼스로부터 자동으로 외래어 사전을 추출해 내는 확률적 정렬 방법과 실험결과를 소개한다. 확률적 정렬 방법은 통계적 음차 표기 모델에서 사용된 방법을 변형하여 적용한 것이며, 문서단위로 정렬된 두 종류의 영-한 이중언어 코퍼스에 대해 실험하여 재현률과 정확률을 측정하였다 성능은 전처리단계인 한국어 미등록어 추정에 영향을 많이 받았는데, 미등록어 추정을 대략하였을 경우, 재현률은 평균 58%였고, 정확률은 평균74%이었으며, 수동으로 미등록어 명사를 분리했을 경우, 재현률 평균86%, 정확률 평균91%로 외래어와 대응되는 원어를 추출해 냈다.

  • PDF

CRF를 이용한 생물/의학 전문용어 인식 (Biomedical Terminology Recognition using CRF)

  • 배영준;김재훈;옥철영;최윤수
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2009년도 제21회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.87-91
    • /
    • 2009
  • 전문용어의 수가 급증하면서 전문용어를 자동으로 인식하는 연구가 활발히 진행되고 있다. 전문용어를 인식하기 위해서 전문용어의 범위를 정한 뒤 그 전문용어의 분야를 선택해야 한다. 본 논문에서는 생물/의학 사전정보와 CRF(Conditional Random Fields) 기계학습 기법을 사용하여 연구를 진행한다. 기계학습을 위한 자질로 품사, 접사, 대소문자, 숫자, 특수문자, 단서어휘 등을 사용한다. 특히 단서어휘와 사전정보를 중요한 요소로 생각하여, 3가지 방법으로 나누어 실험한다. 총 분야의 개수는 7개이며, 각 분야별로 정확률, 재현율, F-measure를 측정한다. 경계인식은 83.92%의 정확률, 96.42%의 재현율, 89.73의 F-measure가 결과로 나타났고, 분야분류는 79.29%의 정확률, 91.06%의 재현율, 84.77%의 F-measure가 결과로 나타났다.

  • PDF