• 제목/요약/키워드: 데이터 결측

검색결과 136건 처리시간 0.03초

해양모니터링 자료의 장기결측 보충 기법 (Long-gap Filling Method for the Coastal Monitoring Data)

  • 조홍연;이기섭;이욱재
    • 한국해안·해양공학회논문집
    • /
    • 제33권6호
    • /
    • pp.333-344
    • /
    • 2021
  • 해양모니터링 자료에서 빈번하게 발생하는 장기결측구간의 자료 보충기법을 제안한다. 제안하는 방법은 결측구간의 장기변동 추세 성분과 단기변동 잔차성분을 추정하여 조합하는 방식으로 결측구간의 미지 정보를 추정한다. 이 방법을 이용하여 울릉도 해상부이 자료의 수온 항목, 약 1개월 정도의 장기결측 구간의 자료를 보충하였으며, 부이에서 관측하는 자료 항목에 대해서도 결측 보충을 수행하였다. 보충된 자료는 항목에 따라 차이를 보이지만 변동양상이 적절하게 재현되는 것으로 파악되었다. 이 방법은 추세추정과 잔차 반영에 따른 편향오차와 분산오차가 발생하지만, 장기결측으로 인한 통계적인 측도 추정의 편향오차는 크게 절감하는 것으로 파악되었다. 결측보충 모형의 추정 RMS 오차의 평균과 90% 신뢰구간은 각각 0.93, 0.35~1.95 범위이다.

Support Vector Regression을 이용한 희소 데이터의 전처리 (A Sparse Data Preprocessing Using Support Vector Regression)

  • 전성해;박정은;오경환
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국퍼지및지능시스템학회 2004년도 춘계학술대회 학술발표 논문집 제14권 제1호
    • /
    • pp.499-501
    • /
    • 2004
  • 웹 로그, 바이오정보학 둥 여러 분야에서 다양한 형태의 결측치가 발생하여 학습 데이터를 희소하게 만든다. 결측치는 주로 전처리 과정에서 조건부 평균이나 나무 모형과 같은 기본적인 Imputation 방법을 이용하여 추정된 값에 의해 대체되기도 하고 일부는 제거되기도 한다. 특히, 결측치 비율이 매우 크게 되면 기존의 결측치 대체 방법의 정확도는 떨어진다. 또한 데이터의 결측치 비율이 증가할수록 사용 가능한 Imputation 방법들의 수는 극히 제한된다. 이러한 문제점을 해결하기 위하여 본 논문에서는 Vapnik의 Support Vector Regression을 데이터 전처리 과정에 알맞게 변형한 Support Vector Regression을 제안하여 이러한 문제점들을 해결하였다. 제안 방법을 통하여 결측치의 비율이 상당히 큰 희소 데이터의 전처리도 가능하게 되었다. UCI machine learning repository로부터 얻어진 데이터를 이용하여 제안 방법의 성능을 확인하였다.

  • PDF

딥러닝 분석을 위한 수문시계열 입력자료 구성 기법 개발 (Development of a method for constructing hydrological time series input data for deep learning analysis)

  • 육지문;조혜린;박찬호;문수진;문영일
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2021년도 학술발표회
    • /
    • pp.349-349
    • /
    • 2021
  • 일반적인 도시홍수모형은 수리-수문모형을 기반으로 한 홍수위 모형을 사용하고 있으나 강우사상이나 물리적 조건에 따라 모의시간의 변화가 있으며 경우에 따라서는 긴 모의시간이 소요된다. 알파고 이후 큰 관심을 갖게된 딥러닝을 이용한 데이터기반의 모의를 통해 수자원 부분에 적용하여 수위 예측을 진행하였다. 본 연구에서는 딥러닝을 이용하여 관측자료기반의 수위예측 연구를 수행하였다. 대상유역은 중랑천 유역으로 선정하였으며 2015년 ~ 2020년 사이의 10분단위 강우, 수위자료를 이용하였다. 지방자치단체에서 제공하는 강우, 수위자료의 경우 결측자료 또는 이상자료에 대한 보정이 미흡하여 기계학습을 통합 분석자료로 활용하는데 어려움이 있다. 이에, 결측 및 이상자료가 포함된 자료로부터 인위적으로 교란된 데이터 및 결측구간을 삭제한 데이터를 생성하여 자료의 시계열성을 제거하고, 딥러닝을 통한 수위 예측 결과를 정상 데이터를 적용한 결과와 비교하였다. 사용된 딥러닝 모형은 시계열 데이터 예측에 우수한성능을 보이는 LSTM모형과 GRU모형을 이용하였으며 RMSE, NSE를 이용하여 평가하였다. 본 연구에서는 결측자료 및 이상자료가 포함된 수문자료를 자료의 시계열성 제거를 통해 딥러닝 분석 입력자료 구성하기 위한 방안을 제시하였다.

  • PDF

Missing Value Imputation Technique for Water Quality Dataset

  • Jin-Young Jun;Youn-A Min
    • 한국컴퓨터정보학회논문지
    • /
    • 제29권4호
    • /
    • pp.39-46
    • /
    • 2024
  • 많은 연구자들이 다양한 모델을 이용하여 물의 수질을 평가하기 위해 노력하고 있다. 평가 모델에는 결측값이 없는 데이터셋이 필요하지만, 관측 데이터셋에는 결측값이 다수 포함되는 것이 현실이다. 단순히 결측값을 삭제하는 방법은 경우에 따라 기저 데이터의 분포를 왜곡시키고 모델의 예측성능에도 편의(bias)를 불러올 위험성이 있다. 본 연구에서는 수질 데이터의 결측값 처리에 적합한 기법을 탐색하기 위해, 기존의 KNN과 MICE Imputation, 그리고 생성형 신경망 모델인 Autoencoder와 Denoising Autoencoder를 기반으로 몇 가지 대치 기법을 실험하였다. 실험 결과, KNN과 MICE Imputation의 결과를 평균한 Combined Imputation이 실측치에 가장 가깝게 값을 추정하였으며, 이 기법을 적용하여 결측값을 처리한 관측 데이터셋을 support vector machine과 ensemble 기반의 분류 모델로 평가한 결과, 결측값을 삭제했을 때에 비해 Accuracy, F1 score, ROC-AUC score, 그리고 MCC(Mathews Correlation Coefficient) 지표가 향상되었다.

차량 검지자료 결측 보정처리에 관한 연구 (이력자료 활용방안을 중심으로) (A Study on the Imputation for Missing Data in Dual-loop Vehicle Detector System)

  • 김정연;이영인;백승걸;남궁성
    • 대한교통학회지
    • /
    • 제24권7호
    • /
    • pp.27-40
    • /
    • 2006
  • 교통정보는 운영 중인 VDS(Vehicle Detector System)를 통해 수집된 교통량, 속도, 점유율 자료를 바탕으로 가공되어 제공된다. 수집된 자료의 응용범위와 이용자 및 활용분야는 점점 증가하는 추세에 있다. 수집된 차량 검지자료 내의 결측자료는 대상의 속성을 포함하지 않은 채 전송되는 일련의 빈 데이터를 말한다. 결측자료는 속성 값을 갖고 있지 않은 관계로 데이터가공 처리대상에서 제외된다. 결국 수집 데이터 내의 결측자료의 비율이 증가할수록 해당 지점의 교통상황을 반영하는데 있어 신뢰성이 결여되는 문제점을 갖게 된다. 본 연구에서는 결측자료에 대해 인접지점 참조방식과 이력자료를 활용한 방법론을 적용한 보정처리 결과를 제시하였다 현재 운영 중인 서해안/경부고속도로의 VDS 자료에 임의의 결측자료 비율을 처리 후 보정처리 방법론을 적용하였다. 보정단위는 차로단위-30초 주기로 수행하였으며 오전/오후/일단위로 구분하여 원데이터 대비 보정된 값의 오차를 분석하였다. 분석결과 인접지점 참조방식에 비해 이력자료를 활용한 보정처리 방법이 원데이터에 가까운 값을 도출하는 것을 알 수 있었다.

GAN 기반 관절 데이터 생성을 통한 행동 인식 방법 설계 (A Design of Behavior Recognition method through GAN-based skeleton data generation)

  • 김진아;문남미
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2022년도 추계학술발표대회
    • /
    • pp.592-593
    • /
    • 2022
  • 다중 데이터 기반의 행동 인식 과정에서 데이터 수집 반경이 비교적 제한되는 영상 데이터의 결측에 대한 보완이 요구된다. 본 논문에서는 6축 센서 데이터를 이용하여 결측된 영상 데이터를 생성함으로써 행동 인식의 성능을 개선하는 방법을 제안한다. 가속도와 자이로 센서로부터 수집된 행동 데이터를 이용하여 GAN(Generative Adversarial Network)을 통해 영상에서의 관절(Skeleton) 움직임에 대한 데이터를 생성하고자 한다. 이를 위해 DeepLabCut 기반 모델 학습을 통해 관절 좌표를 추출하며, 전처리된 센서 시퀀스 데이터를 가지고 GRU 기반 GAN 모델을 통해 관절 좌표에 대한 영상 시퀀스 데이터를 생성한다. 생성된 영상 시퀀스 데이터는 영상 데이터의 결측이 발생했을 때 대신 행동 인식 모델의 입력값으로 활용될 수 있어 성능 향상을 기대할 수 있다.

TCS데이터를 이용한 이상치제거 및 결측보정 알고리즘 개발 (Outlier Filtering and Missing Data Imputation Algorithm using TCS Data)

  • 도명식;이향미;남궁성
    • 대한교통학회지
    • /
    • 제26권4호
    • /
    • pp.241-250
    • /
    • 2008
  • 지능형 교통체계구축과 교통 혼잡이 증가하면서 이용자는 과거보다 양질의 통행시간정보를 요구하고 있다. 기존 연구에서는 단속류, 연속류 모두 AVI검지기 자료를 이용한 이상치제거 및 통행시간 산출에 대한 연구가 많이 이루어져왔다. 현재 한국도로공사에서는 TCS(Toll Collection System)를 기반으로 정보제공을 준비 중에 있으며, TCS 데이터는 운전자가 실제교통상황을 경험한 동적특성을 가진 통행시간이 수집된 자료로 통행시간 추정자료로 잠재력이 크다. 그러나 '시간처짐현상'이 발생하고 속도위반, 휴게소, 고장 등으로 인해 평균통행시간보다 작거나 큰 이상치와 결측데이터가 존재하여 기존 방법을 적용하는데 효과적이지 못한 것으로 나타났다. 따라서 본 연구에서는 TCS 데이터에 맞는 이상치제거 및 결측보정 알고리즘을 개발하였다. 기존알고리즘과 비교한 결과 개발 알고리즘이 더 효과적인 것으로 나타났다.

데이터 오·결측 저감 정제 알고리즘 (Data Cleansing Algorithm for reducing Outlier)

  • 이종원;김호성;황철현;강인식;정회경
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2018년도 추계학술대회
    • /
    • pp.342-344
    • /
    • 2018
  • 본 논문에서는 기존 오 결측 데이터 분석 기법인 평균 대체법, 상관계수 수치분석, 그래프 상관성 분석 및 통계 전문가 분석 등 통계적 방법으로 대체 가능성을 조사하여 정수처리 공정에서 계측되는 각종 이상 데이터를 정제하기 위한 방법을 다양한 분석연구로 진행하였다. 또한 물 정보 데이터 오 결측 저감 정제 알고리즘의 신뢰성 및 검증에 있어 분위수 패턴과 딥러닝 기반의 LSTM 알고리즘으로 동작하는 시스템을 모델링하고, Keras, Theano, Tensorflow 등의 오픈 소스 라이브러리로 구현할 수 있는 체계를 연구하였다.

  • PDF

LSTM 알고리즘을 이용한 수도데이터 정제기법 (A Study on the cleansing of water data using LSTM algorithm)

  • 유기현;김종립;신강욱
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2017년도 추계학술대회
    • /
    • pp.501-503
    • /
    • 2017
  • 수도분야에서는 정수장 및 관말 관로 상의 전 공정에서 유량, 압력, 수질, 수위 등 다양한 데이터를 수집하고 있다. 수집되는 데이터는 각 정수장 DB에 저장되며, 권역별 DB에서 합쳐져 수자원공사 본사의 DB 서버에 최종 저장된다. 측정기기가 데이터를 측정하거나 여러 과정에 걸쳐 데이터가 통신될 때 다양한 이상 데이터가 발생할 수 있으며 크게 결측 데이터와 오측 데이터로 분류할 수 있다. 각각의 이상 데이터의 발생원인은 상이하다. 따라서 오측 및 결측 데이터를 검출하는 방식에는 차이가 있으나 실제 이를 정제하는 방식은 동일하다. 본 연구에서는 딥러닝 알고리즘의 일종인 LSTM(Long Short Term Memory) 방식을 적용하여 오 결측 데이터를 자동으로 정제할 수 있는 프로그램에 대하여 고찰한다.

  • PDF

혼합형 데이터 보간을 위한 디노이징 셀프 어텐션 네트워크 (Denoising Self-Attention Network for Mixed-type Data Imputation)

  • 이도훈;김한준;전종훈
    • 한국콘텐츠학회논문지
    • /
    • 제21권11호
    • /
    • pp.135-144
    • /
    • 2021
  • 최근 데이터 기반 의사결정 기술이 데이터 산업을 이끄는 핵심기술로 자리 잡고 있는바, 이를 위한 머신러닝 기술은 고품질의 학습데이터를 요구한다. 하지만 실세계 데이터는 다양한 이유에 의해 결측값이 포함되어 이로부터 생성된 학습된 모델의 성능을 떨어뜨린다. 이에 실세계에 존재하는 데이터로부터 고성능 학습 모델을 구축하기 위해서 학습데이터에 내재한 결측값을 자동 보간하는 기법이 활발히 연구되고 있다. 기존 머신러닝 기반 결측 데이터 보간 기법은 수치형 변수에만 적용되거나, 변수별로 개별적인 예측 모형을 만들기 때문에 매우 번거로운 작업을 수반하게 된다. 이에 본 논문은 수치형, 범주형 변수가 혼합된 데이터에 적용 가능한 데이터 보간 모델인 Denoising Self-Attention Network(DSAN)를 제안한다. DSAN은 셀프 어텐션과 디노이징 기법을 결합하여 견고한 특징 표현 벡터를 학습하고, 멀티태스크 러닝을 통해 다수개의 결측치 변수에 대한 보간 모델을 병렬적으로 생성할 수 있다. 제안 모델의 유효성을 검증하기 위해 다수개의 혼합형 학습 데이터에 대하여 임의로 결측 처리한 후 데이터 보간 실험을 수행한다. 원래 값과 보간 값 간의 오차와 보간된 데이터를 학습한 이진 분류 모델의 성능을 비교하여 제안 기법의 유효성을 입증한다.