• Title/Summary/Keyword: Missing Values

검색결과 441건 처리시간 0.021초

순차적 부분최소제곱 회귀적합에 의한 시간경로 유전자 발현 자료의 결측치 추정 (Missing Values Estimation for Time Course Gene Expression Data Using the Sequential Partial Least Squares Regression Fitting)

  • 김경숙;오미라;백장선;손영숙
    • 응용통계연구
    • /
    • 제21권2호
    • /
    • pp.275-290
    • /
    • 2008
  • 마이크로어레이 유전자 발현 자료는 대용량이며 또한 관측 과정이 복잡하여 결측치가 빈번하게 발생된다. 본 논문에서는 관측 시점 간에 상관성을 갖는 시간경로 유전자 발현 자료에 대한 결측치 추정을 위하여 순차적 부분최소제곱(sequential partial least squares: SPLS) 회귀적합 방법을 제안한다. 이는 순차적 기법과 부분최소제곱(partial least squares: PLS) 회귀적합 방법을 결합시킨 것이다. 세 가지의 이스트(yeast) 시간경로 자료들에 대한 몇 가지 모의실험을 통하여 제안된 결측치 추정방법의 유용성을 평가한다.

시간경로 유전자 발현자료에서 패턴일치지수와 적응 최근접 이웃을 활용한 결측값 대치법 (Missing values imputation for time course gene expression data using the pattern consistency index adaptive nearest neighbors)

  • 신혜서;김동재
    • 응용통계연구
    • /
    • 제33권3호
    • /
    • pp.269-280
    • /
    • 2020
  • 시간경로 유전자 발현 자료는 마이크로어레이 실험을 시간에 따라 관측한 대용량의 자료로 유전자 발현 수준을 동시에 파악할 수 있다. 하지만 실험 과정이 복잡하여 다양한 원인들에 의해 결측값이 자주 발생한다. 본 논문에서는 시간경로 유전자 발현 자료에 대한 결측값을 추정하는 방법으로 패턴 적응 최근접 이웃(pattern consistency index adaptive nearest neighbors; PANN) 방법을 제안하였다. 이 방법은 국소적 특징을 반영하는 적응 최근접 이웃(adaptive nearest neighbors; ANN) 방법과 관측 시점간 유전자 발현의 일치 정도를 고려하는 패턴일치지수를 결합시킨 것이다. 제안한 PANN 방법의 효능을 평가하기 위하여 두 가지의 실제 시간경로 자료들을 사용하여 몬테카를로 모의실험(Monte Carlo simulation study)을 시행하였다.

1D-CNN-LSTM Hybrid-Model-Based Pet Behavior Recognition through Wearable Sensor Data Augmentation

  • Hyungju Kim;Nammee Moon
    • Journal of Information Processing Systems
    • /
    • 제20권2호
    • /
    • pp.159-172
    • /
    • 2024
  • The number of healthcare products available for pets has increased in recent times, which has prompted active research into wearable devices for pets. However, the data collected through such devices are limited by outliers and missing values owing to the anomalous and irregular characteristics of pets. Hence, we propose pet behavior recognition based on a hybrid one-dimensional convolutional neural network (CNN) and long short- term memory (LSTM) model using pet wearable devices. An Arduino-based pet wearable device was first fabricated to collect data for behavior recognition, where gyroscope and accelerometer values were collected using the device. Then, data augmentation was performed after replacing any missing values and outliers via preprocessing. At this time, the behaviors were classified into five types. To prevent bias from specific actions in the data augmentation, the number of datasets was compared and balanced, and CNN-LSTM-based deep learning was performed. The five subdivided behaviors and overall performance were then evaluated, and the overall accuracy of behavior recognition was found to be about 88.76%.

상시조사 교통량 자료의 결측 보정에 관한 연구 (A Study on Imputing the Missing Values of Continuous Traffic Counts)

  • 이상협;신재명
    • 대한토목학회논문집
    • /
    • 제33권5호
    • /
    • pp.2009-2019
    • /
    • 2013
  • 교통량은 교통망 계획, 도로 설계, 도로 관리 등에 직접적으로 활용되는 중요한 기초자료이다. 교통량은 고정식 교통량조사 장비를 설치하여 연속적인 자료를 수집하는 상시조사와 특정일을 조사하는 수시조사로 구분되어 조사되고 있다. 상시조사의 경우 조사 지점에 설치되어 있는 장비의 고장이나 오작동 등으로 인하여 교통량 자료의 결측이 발생하며, 이러한 결측을 보정하기 위하여 다양한 방법이 적용되어 왔다. 본 연구에서는 결측 발생일 전 후의 자료를 활용하는 응용 지수평활화법을 제안하였으며, 평가 결과 교통량 변동계수가 낮은 경우 보정의 정확성이 제고됨을 알 수 있었다. 게다가 지점의 교통량 변동성이 결측 보정의 정확성에 영향을 미치는 중요한 요인으로 작용한다는 것을 확인하였다. 따라서 교통량 결측 보정의 신뢰성을 높이기 위해서는 지점별-시기별 결측 보정 방법이 달리 적용되어야 할 것이다.

Imputation of Missing values

  • 윤성철
    • 대한예방의학회:학술대회논문집
    • /
    • 대한예방의학회 2004년도 하계워크샵 및 전공의 연수교육 강의집
    • /
    • pp.1-11
    • /
    • 2004
  • PDF

다형질 Threshold 개체모형에서 Missing 기록을 포함한 이산형 자료에 대한 Bayesian 분석 (Bayesian Analysis for Categorical Data with Missing Traits Under a Multivariate Threshold Animal Model)

  • 이득환
    • Journal of Animal Science and Technology
    • /
    • 제44권2호
    • /
    • pp.151-164
    • /
    • 2002
  • 한우의 근내지방도 또는 임신 여부 등과 같이 이산형 분포의 성질을 갖는 다수의 형질들에 대한 유전모수 및 종축의 유전능력을 평가하기 위한 방법으로써 Threshold 모형하에서 Bayesian 추론방법의 일종인 Gibbs sampling방법을 모의실험을 통하여 알아보았으며 기록이 누락된 다수의 형질을 포함하는 다형질 Threshold 개체모형에서의 종축평가 방법론을 제시하였다. 이산형 형질의 관측치에 대응하는 임의의 잠재변수는 기록을 갖고 있는 형질들에 대한 사전정보를 고려한 사후조건확률분포에서 Gibbs sampling을 할 때 모수에 근접하는 확률분포를 얻을 수 있었으며 이러한 이산형 기록들에 대한 육종가 추정치는 선형모형에서 보다 Threshold 모형에서의 추정치가 실제 모수에 더욱 근접하는 것을 알 수 있었다. 따라서 기록이 누락된 개체들에 대한 이산형 분포를 갖는 형질들에 대하여 선형분포를 갖는 형질들과 함께 동시 유전분석할 때 Threshod 모형이 일반 선형모형 보다 적합함을 알 수 있었다.

선형판별분석에서 MCMC다중대체법의 효율에 관한 연구 (A Study on the efficiency of the MCMC multiple imputation In LDA)

  • 유희경;김명철
    • 대한안전경영과학회지
    • /
    • 제11권3호
    • /
    • pp.189-198
    • /
    • 2009
  • This thesis studies two imputation methods, the MCMC method and the EM algorithm, that take care of the problem. The performance of the two methods for the linear (or quadratic) discriminant analysis are evaluated under various types of incomplete observations. Based on simulated experiments, the effect of the imputation using the EM algorithm and the MCMC method are evaluated and compared in terms of the probability of misclassification and the RMSE. This is done for the various cases of incomplete observations. The cases are differentiated by missing rates, sample sizes, and distances between two classification groups. The studies show that the probability of misclassification and the RMSE of the EM algorithm method is lower than the MCMC method. Therefore the imputation using the EM algorithm is more efficient than the MCMC method. And the probability of misclassification of the method that all vectors of observations with missing values are omitted from analysis is lower than the EM algorithm and the MCMC method when the samples size is small and the rate of missing values is extremely big.

한강 하구부에서 결측된 탁도 자료의 보완 (Filling Analysis for Missing Turbidity Data in Han River Estuary)

  • 백경오;조홍연;이삼희
    • 한국수자원학회논문집
    • /
    • 제39권4호
    • /
    • pp.289-298
    • /
    • 2006
  • 한강 하구부의 3개 지점에서 수중 계류방식으로 약 5개월에 걸쳐 탁도를 관측하였다. 이 과정에서 관측기기의 한계로 인해 탁도 자료의 결측치가 발생하였고, 이를 효율적으로 보완하기 위해 본 연구에서는 새로운 결측치 보완기법을 개발하였다. 개발된 기법은 시계열 자료가 단일주기와 상이한 진폭을 갖는다는 가정하에, 각 사이클의 면적비율을 통해 결측치를 보완하는 방법이다. 이 기법을 결측되지 않은 정상적인 자료로 검증해 보면, 첨두치가 약간 과소 산정되는 경향이 있으나 총 면적은 보완 전, 후에 거의 차이가 없었다. 따라서 새로운 기법을 바탕으로 한강 하구부에서 관측된 탁도자료의 결측치를 합리적으로 보완할 수 있었다.