• 제목/요약/키워드: 대체 방법

검색결과 4,117건 처리시간 0.025초

결측값 대체를 위한 데이터 재현 기법 비교 (Comparison of Data Reconstruction Methods for Missing Value Imputation)

  • 김청호;강기훈
    • 문화기술의 융합
    • /
    • 제10권1호
    • /
    • pp.603-608
    • /
    • 2024
  • 무응답 및 결측값은 표본 탈락, 설문조사에 대한 답변 회피 등으로 발생하며 정보의 손실 및 편향된 추론의 가능성이 있는 문제가 발생하게 되며, 이 경우 결측값을 적절한 값으로 바꾸는 대체가 필요하게 된다. 본 논문에서는 결측값에 대한 대체 방법으로 제안되었던 평균 대체, 다중회귀 대체, 랜덤 포레스트 대체, K-최근접 이웃 대체, 그리고 딥러닝을 기본으로 한 오토인코더 대체와 잡음제거 오토인코더 대체 방법을 비교한다. 결측값을 대체하는 이러한 방법들에 대해 설명하고, 연속형의 모의실험 데이터와 실제 데이터에 접목시켜 각 방법들을 비교하였다. 비교 결과 대부분의 경우에서 다중 대체 방법인 랜덤 포레스트 대체 방법과 잡음제거 오토인코더 대체 방법의 성능이 좋았음을 확인하였다.

무응답 대체 방법과 대체 효과 (Imputation Methods for Nonresponse and Their Effect)

  • 김규성
    • 한국조사연구학회:학술대회논문집
    • /
    • 한국조사연구학회 2000년도 춘계학술대회 조사연구의 방법론적 쟁점
    • /
    • pp.1-14
    • /
    • 2000
  • 사회.경제조사에서 흔히 발생하는 무응답에 대한 통계적 대처 방안을 고찰하였다. 항목 무응답이 발생했을 때 무응답 데이터를 포함하지 않는 완전 데이터를 만드는 방법으로 무응답 대체 방법이 널리 이용되고 있다. 본 논문에서는 여러 가지 대체 방법을 소개하고 각 방법의 장.단점을 비교.설명하였다. 또한 대체된 데이터를 응답 데이터인 것처럼 활용했을 때 발생하는 문제점들을 지적하였다. 무응답을 대체하면 대체된 값들 때문에 대체 후 추정량의 분산은 대체 분산만큼 증가하는 반면, 대체된 데이터에 기초한 통상적인 분산추정량은 대체 분산을 추정하지 못하므로 결과적으로 대체 후 추정량의 분산을 과소추정하게 된다. 이러한 분산의 과소추정의 원인을 이론적으로 고찰하였고, 모의실험을 통하여 그 결과의 심각성을 설명하였다. 마지막으로 분산의 과소 추정 문제를 해결하는 몇 가지 수정된 분산추정 방법을 소개하고 토의하였다.

  • PDF

무응답 대체 방법과 대체 효과 (Imputation Methods for Nonresponse and Their Effect)

  • 김규성
    • 한국조사연구학회지:조사연구
    • /
    • 제1권2호
    • /
    • pp.1-14
    • /
    • 2000
  • 사회${\cdot}$경제조사에서 흔히 발생하는 무응답에 대한 통계적 대처 방안을 고찰하였다. 항목 무응답이 발생했을 때 무응답 데이터를 포함하지 않는 완전 데이터를 만드는 방법으로 무응답 대체 방법이 널리 이용되고 있다. 본 논문에서는 여러 가지 대체 방법을 소개하고 각 방법의 장${\cdot}$단점을 비교${\cdot}$설명하였다. 또한 대체된 데이터를 응답 데이터인 것처럼 활용했을 때 발생하는 문제점들을 지적하였다. 무응답을 대체하면 대체된 값들 때문에 대체 후 추정량의 분산은 대체 분산만큼 증가하는 반면, 대체된 데이터에 기초한 통상적인 분산추정량은 대체 분산을 추정하지 못하므로 결과적으로 대체 후 추정량의 분산을 과소추정하게 된다. 이러한 분산의 과소추정의 원인을 이론적으로 고찰하였고, 모의실험을 통하여 그 결과의 심각성을 설명하였다. 마지막으로 분산의 과소추정 문제를 해결하는 몇 가지 수정된 분산추정 방법을 소개하고 토의하였다.

  • PDF

패널자료에서의 항목무응답 대체 방법 비교 (Comparison of imputation methods for item nonresponses in a panel study)

  • 이혜정;송주원
    • 응용통계연구
    • /
    • 제30권3호
    • /
    • pp.377-390
    • /
    • 2017
  • 설문조사를 실시할 때 응답자가 설문조사의 일부 문항에 대하여 응답하지 않는 경우 항목무응답이 발생한다. 무응답이 발생한 자료를 제외하고 완전하게 응답된 자료 만에 근거한 분석은 분석 결과에 편의가 발생할 수 있으므로, 이를 채워 넣어 완전한 형태의 자료로 분석하기 위해서 무응답 대체가 흔히 사용되고 있으며 여러 가지 무응답 대체 기법들을 비교하는 연구들도 많이 존재한다. 패널조사 연구는 연구 대상 패널에 대하여 정해진 시간에 따라 반복적으로 동일한 설문 문항에 대하여 응답을 조사하여 시간에 따른 변화를 살펴보는 조사 방법을 나타낸다. 패널조사 자료의 항목 무응답을 대체할 때 이전 시점의 응답 자료가 존재한다면 이를 포함하여 대체를 실시하는 것이 바람직한 것으로 여겨져 왔으나 이에 관한 직접적인 연구는 찾기 힘들다. 따라서 본 연구에서는 패널자료에서 이전 시점의 정보를 고려하지 않고 대체를 실시하는 방법과 이전 시점의 정보를 활용하여 대체하는 방법들 중에서 어느 대체 방법이 보다 적절한 대체를 제공하는지 살펴보았다. 특히 이전 시점의 응답 정보를 이용하는 방법인 비대체, 선형혼합모형을 이용한 대체와 선형혼합모형에 근거한 베이지안 대체 방법을 고려하였고, 이를 이전 시점의 정보를 고려하지 않는 대체 방법들 중 흔히 사용되는 평균대체, 핫덱대체 방법과 비교하였다. 모의실험 결과 선형혼합모형에 근거한 베이지 안 대체 방법이 다른 대체 방법에 비해 무응답 비율이 높아지더라도 편의도 작으며 평균에 관한 95% 신뢰구간의 포함률도 높게 나타나서 가장 좋은 대체 방법으로 확인되었다.

대체방법별 GEE추정량 비교 (Comparison of GEE Estimators Using Imputation Methods)

  • 김동욱;노영화
    • 응용통계연구
    • /
    • 제16권2호
    • /
    • pp.407-426
    • /
    • 2003
  • 본 연구에서는 범주형 반복측정자료의 일반화추정방정식(GEE)모형에서 결측이 발생할 경우 결측값 대체(imputation)방법들에 대한 성능을 비교하고자 한다. 설명변수 X가 부분적으로 결측을 갖는 경우 GEE추정량을 계산할 수 없다. 본 논문에서는 시점에 따라 값이 변하는 설명변수에 결측이 있는 경우 GEE모형에서 결측값을 추정하는 7가지의 대체방법을 다루며, 실제자료와 모의실험을 통하여 대체방법별 GEE추정량의 성질을 연구한다. 대체방법별 GEE추정량의 성능을 비교하기 위해 우리는 반응변수가 범주형인 반복측정모형에서 완전자료의 GEE추정량과 완전자료에서 결측을 생성하여 결측값에 각 대체방법을 적용하여 대체한 후 구한 GEE추정량을 비교한다. 대체방법으로는 (1) 단순삭제 (2) 표본 평균대체 (3) 행 평균대체 (4) 횡 시점 회귀대체 (5) 이월대체 (6) 베이지안 붓스트랩 (7) 근사적 베이지안 붓스트랩에 대해서 살펴본다. 결측과정(missing mechanism)은 무시할 수 있는 무응답(ignorable nonresponse)을 가정하며, 결측 발생에 대해서는 원자료의 시점 무응답 패턴(wave nonresponse pattern)을 고려하여 발생시키거나 또는 시점 무응답 패턴을 고려하지 않고 단순임의추출로 결측을 발생시키는 방법을 각각 고려한다.

무응답 대체 후 발생하는 문제점과 해결 방안

  • 김규성
    • 한국조사연구학회:학술대회논문집
    • /
    • 한국조사연구학회 2000년도 춘계학술대회 조사연구의 방법론적 쟁점
    • /
    • pp.105-112
    • /
    • 2000
  • 대부분 통계조사에서 흔히 발생하는 무응답을 처리하기 위한 방법으로 최근에는 표본 대체 방법이 널리 이용되고 있다. 본 논문에서는 여러 가지 표본 대체 방법을 소개하고 각 방법의 장. 단점을 비교. 설명한다. 그리고 대체된 데이터를 응답 데이터인 것처럼 활용했을 때 발생하는 문제점들을 지적하고 모의 실험을 통하여 그 정도를 살펴본다. 이와 더불어 제기된 문제점을 해결하는 몇 가지 해결방안을 소개한다.

  • PDF

비선형 모델을 이용한 결측 대체 방법 비교 (A comparison of imputation methods using nonlinear models)

  • 김혜인;송주원
    • 응용통계연구
    • /
    • 제32권4호
    • /
    • pp.543-559
    • /
    • 2019
  • 자료에는 다양한 원인에 의해 결측이 발생한다. 만약 결측치를 제외하고 완전히 관찰된 자료만으로 분석을 실시한다면 결측자료 메커니즘이 완전임의결측이 아닌 경우 결과에 편향이 발생하거나 제외된 개체로 인한 정보의 손실로 추정의 정밀도가 약화된다. 결측이 하나의 변수에서만 일어나지 않기 때문에, 자료에 변수가 많을 수록 이 문제는 심화된다. 문제를 개선하기 위해 결측치를 대체하는 여러가지 방법들이 제안되었다. 하지만 모수적인 모형을 이용한 대체 방법들은 가정에 위배되는 현실 데이터에는 적합하지 않다. 따라서 본 연구에서는 자료의 분포 가정에 덜 영향을 받는 커널, 리샘플링, 스플라인 방법을 활용한 비선형 대체 방법들을 리뷰하고 필요한 경우 기존의 비선형 대체 방법에 대체클래스를 사용하여 대체값의 정확도를 높이거나 랜덤성을 가지는 오차를 더해주어 추정치의 분산이 적게 추정되는 문제를 개선하는 확장된 결측 대체 방법을 제안한다. 본 연구에서 고려한 여러 가지 대체 방법들은 다양한 모의자료 설계 하에서 성능을 비교하였다. 모의실험 결과, 비선형 대체 방법들은 각 설계 하에 다른 성능을 보이며 전반적으로 커널 회귀나 스플라인을 활용한 대체 방법들이 좋은 성능을 보였다. 더불어, 확장된 대체 방법은 기존의 대체 방법이 가지는 문제점을 개선함을 확인할 수 있었다.

임상시험에서 이분형 결측치 처리방법의 비교연구 (Comparison of binary data imputation methods in clinical trials)

  • 안구성;김동재
    • 응용통계연구
    • /
    • 제29권3호
    • /
    • pp.539-547
    • /
    • 2016
  • 임상시험에서 흔히 발생하는 결측치 중 이분형 결측치에 대한 논의를 하였다. 본 논문에서는 결측치가 발생하는 기재를 논의하고 기존의 여러 이분형 결측치 대체 방법과 수정된 결측치 대체방법을 소개하였다. 이후 각 결측치 대체 방법을 실제 자료에 적용하여 모의 실험을 진행하였다. 실제 자료의 성격 및 결측률의 변화에 따른 결측치 대체 방법들의 성능비교를 통해 진행하였다. 마지막으로 각 결측치 대체 방법에 대한 모의 실험 결과를 요약하고 토의하였다.

패널조사 웨이브 무응답의 대체방법 비교 (Comparisons of Imputation Methods for Wave Nonresponse in Panel Surveys)

  • 김규성;박인호
    • 한국조사연구학회지:조사연구
    • /
    • 제11권1호
    • /
    • pp.1-18
    • /
    • 2010
  • 본 논문에서는 패널조사에서 발생하는 웨이브 무응답을 대체하는 방법을 고찰하였다. 패널조사에서는 이전 조사 데이터를 무응답 대체에 활용할 수 있기 때문에 이러한 성질을 이용하면 횡단면 무응답 대체보다 더 효과적인 웨이브 무응답 대체법을 찾을 수 있다. 먼저 웨이브 무응답 대체를 사용하는 해외의 주요 패널조사를 살펴보고, 웨이브 무응답 대체방법 중 종단면 회귀대체법, 이월대체법, 최근방 회귀대체법, 그리고 행렬대체법을 고찰하였다. 그리고 웨이브 무응답 대체법의 성능을 비교하기 위하여 한국복지패널 데이터를 대상으로 모의실험을 실시하였다. 성능을 비교하기 위하여 평균대체, 회귀대체, 비대체, 최근방 대체, 핫덱 대체를 고려하였고 성능평가 지표로는 예측 정확성 지표와 추정 정확성 지표를 이용하였다. 모의실험 결과 비대체, 행렬대체는 두 지표 모두 우수했고, 회귀대체, 종단면 회귀대체, 이월대체는 예측 정확성은 우수한 반면 추정 정확성은 다소 떨어졌으며, 반대로 최근방 회귀대체, 최근방 대체, 핫덱 대체는 예측 정확성은 떨어지나 추정 정확성은 높은 것으로 나타났다. 마지막으로 평균 대체는 두 지표 모두 좋지 않았다.

  • PDF

대체에너지 이용 발전전력의 우선구매에 따른 지원규모 산정 (Subsidy for purchasing Power Generation using Renewable Energies)

  • 조인승;이창호
    • 대한전기학회:학술대회논문집
    • /
    • 대한전기학회 2001년도 하계학술대회 논문집 B
    • /
    • pp.1325-1327
    • /
    • 2001
  • 우리나라는 장기전력수급계획 및 10개년 에너지기본계획, 그리고 최근에 수립된 대체에너지보급 3개년 기본계획의 달성 및 보급확대를 위한 보급시나리오 구성에 따른 보급목표를 설정하였다. 대체에너지 지원규모를 산정하기 위한 방법으로는 대체에너지수요전망에서 산출된 대체에너지원별 전망치를 이용, 지원비율을 책정하여 지원규모를 시산하는 방법이 있으며 또 다른 방법으로는 전망된 수요량을 공급하기 위한 시설 및 장비에 드는 투자비를 산출하여 일정비율을 지원한다고 가정한 다음, 지원규모를 시산하는 방법도 있다. 본 연구에서는 후자의 방법을 통하여 재생전원의 보급목표의 설정과 현재의 설치단가를 기준으로 보급에 필요한 설치비용에 대한 지원규모를 개략적으로 분석하고자 하며, 아울러 정부의 대체에너지 보급목표를 달성하기 위한 지원금액을 추정 하고자 한다.

  • PDF