• Title/Summary/Keyword: 선형회귀 분석

Search Result 1,448, Processing Time 0.032 seconds

Prediction of golf scores on the PGA tour using statistical models (PGA 투어의 골프 스코어 예측 및 분석)

  • Lim, Jungeun;Lim, Youngin;Song, Jongwoo
    • The Korean Journal of Applied Statistics
    • /
    • v.30 no.1
    • /
    • pp.41-55
    • /
    • 2017
  • This study predicts the average scores of top 150 PGA golf players on 132 PGA Tour tournaments (2013-2015) using data mining techniques and statistical analysis. This study also aims to predict the Top 10 and Top 25 best players in 4 different playoffs. Linear and nonlinear regression methods were used to predict average scores. Stepwise regression, all best subset, LASSO, ridge regression and principal component regression were used for the linear regression method. Tree, bagging, gradient boosting, neural network, random forests and KNN were used for nonlinear regression method. We found that the average score increases as fairway firmness or green height or average maximum wind speed increases. We also found that the average score decreases as the number of one-putts or scrambling variable or longest driving distance increases. All 11 different models have low prediction error when predicting the average scores of PGA Tournaments in 2015 which is not included in the training set. However, the performances of Bagging and Random Forest models are the best among all models and these two models have the highest prediction accuracy when predicting the Top 10 and Top 25 best players in 4 different playoffs.

A Study on Estimation of Soil Moisture Multiple Quantile Regression Model Using Conditional Merging and MODIS Land Surface Temperature Data (조건부 합성기법과 MODIS LST를 활용한 토양수분 다중분위회귀모형 산정 연구)

  • Jung, Chung Gil;Lee, Ji Wan;Kim, Da Rae;Kim, Se Hun;Kim, Seong Joon
    • Proceedings of the Korea Water Resources Association Conference
    • /
    • 2018.05a
    • /
    • pp.23-23
    • /
    • 2018
  • 본 연구에서는 다중분위회귀분석모형(Multiple Quantile Regression Model, MQRM)과 MODIS(MODerate resolution Imaging Spectroradiometer) LST (Land Surface Temperature) 자료를 이용하여 전국 공간토양수분을 산정하였다. 공간토양수분을 산정하기 위한 과정은 크게 두가지로 구분된다. 첫 번째로 기존의 MODIS LST 자료를 조건부 합성 보정기법을 적용하여 실측 LST 자료와 비교하여 위성 LST 자료가 갖고 있는 오차를 보정하였다. 그 결과, 조건부 합성 보정기법을 적용하기전 전국 71개 지상관측지점에서 관측한 실측 LST와 MODIS LST의 $R^2$는 전체 평균 0.70으로 어는정도 유의성 있는 상관관계를 나타냈으나 조건부 합성 보정기법을 적용한 후 실측 LST와 MODIS LST의 $R^2$는 전체 평균 0.92로 상당히 크게 향상됨을 알 수 있었다. 두 번째로 보정된 MODIS LST를 이용하여 다중분위회귀분석 모형을 개발하고 토양수분을 예측하는 단계로 입력자료로 위성영상 자료와 관측자료를 융합하여 사용하였다. 위성영상 자료로는 보정된 MODIS LST와 MODIS NDV를 구축하였고 일단위 강수량 및 일조시간의 기상자료는 기상청으로부터 전국 71개 지점에 대해 구축하여 IDW 공간보간기법을 이용한 공간자료로 구축하였다. 토양수분 결과를 비교하기 위한 관측 토양수분은 자동농업기상관측(Automated Agriculture Observing System, AAOS)지점에서 2013년 1월부터 2015년 12월까지의 실측 일단위 토양수분 자료를 구축하여 사용하였다. 다중분위회귀분석 모형은 LST 인자를 중심으로 각각의 분위(0.05, 0.25, 0.5, 0.75, 0.95)에 해당되는 값의 회귀식을 NDVI, 강수 입력자료를 독립인자로서 조합하여 계절 및 토성에 따른 총 80개의 회귀식을 산정하였다. 관측 토양수분과 모의 토양수분을 비교한 결과 $R^2$가 0.70 (철원), 0.90 (춘천), 0.85 (수원), 0.65 (서산), 0.78 (청주), 0.82 (전주), 0.62 (순천), 0.63 (진주), 0.78 (보성)로 높은 상관성을 보였다. 본 연구에서는 다중분위회귀 모형의 성능을 검증하기 위해 기존의 다중선형회귀모형의 결과와 비교하여 크게 개선됨을 나타냈다.

  • PDF

Prediction of damages induced by Snow using Multiple-linear regression and Artificial Neural Network model (다중선형회귀 및 인공신경망 모형을 이용한 대설피해에 따른 피해액 예측에 관한 연구)

  • Kwon, Soon Ho;Lee, Eui Hoon;Chung, Gunhui;Kim, Joong Hoon
    • Proceedings of the Korea Water Resources Association Conference
    • /
    • 2017.05a
    • /
    • pp.20-20
    • /
    • 2017
  • 최근 기후변화 영향에 따라 전 세계적으로 인명피해 및 재산피해를 유발하는 자연재난이 지속적으로 증가하고 있으며, 그로 인한 자연재해의 규모가 점점 더 커지고 있다. 실제로 우리나라에서도 지난 1994 년에서 2013 년까지 지난 20 년간 자연재해에 의한 피해액은 12조 3천억 원으로 집계되었으며, 이 중 강우와 태풍에 의한 피해가 85 % 이고, 대설에 의한 피해는 약 13 % 로 자연재해 중 대부분의 피해는 강우 및 태풍에서 발생하지만, 폭설에 의한 피해도 적지 않은 것으로 나타났다. 이에 따라, 정확한 예측을 위해 신뢰도 높은 자료 구축을 통한 대설피해 예측에 관한 연구가 필요한 시점이다. 본 연구에서는 대설피해액 예측을 위해 우리나라의 63개 기상 관측소에서 관측한 적설심 자료 및 기상관측 자료와 사회 경제 자료 총 11개를 대설피해 예측을 위한 입력변수로 선정하고, 이를 기상관측소가 속한 도시의 면적에 따라 3개의 지역으로 구분하였다. 주성분분석을 활용하여 선정된 입력변수들을 4개의 주성분으로 구분하고, 인공신경망 및 다중선형 회귀 모형을 구성하여 각 지역별 대설피해 예측의 오차를 분석하였다. 적용결과, 인공신경망 모형을 이용한 대설피해 예측의 수정결정계수는 22.8 %~48.2 %를 나타냈고, 다중선형회귀 모형의 수정결정 계수는 9.2 %~39.7% 로 나타났다. 그러므로 인공신경망 모형이 다중회귀 모형보다 선택된 입력자료를 활용하여 대설피해를 예측하는 목적으로 조금 더 우수한 결과를 나타내었다. 향후 자료를 보완 및 모형의 고도화를 통해 보다 정확한 대설피해 예측 함수 개발이 가능할 것으로 기대된다.

  • PDF

Information Arrival and Stock Market Volatility Dynamics (정보(情報)의 발생(發生)과 주가(株價)의 변동성(變動性))

  • Rhee, Il-King
    • The Korean Journal of Financial Management
    • /
    • v.16 no.2
    • /
    • pp.285-308
    • /
    • 1999
  • 증권의 가격형성에 유리한 뉴스와 불리한 뉴스가 도착할 때 이 뉴스가 주가의 변동성에 미치는 영향의 정도는 차이가 있다. 불리한 뉴스가 변동성에 미치는 영향도가 유리한 뉴스가 변동성에 미치는 영향도보다 크다. 따라서 불리한 뉴스가 발생할 때 형성되는 변동성의 양이 유리한 뉴스의 도착시보다 크다. 그리고 충격의 크기에 따라 이 충격이 야기하는 변동성의 양의 크기에도 차이가 존재한다. 일반 자기회귀 조건부 이분산 과정은 유리한 뉴스와 불리한 뉴스를 대칭적으로 반영하고 있다. 이 뉴스들을 비대칭적으로 포착하는 자기회귀 조건부 이분산 과정의 모형들을 실증적으로 분석하였다. 뉴스의 비대칭성과 규모를 적절히 포착하고 있는 모형들이 비선형 일반 자기회귀 조건부 이분산 과정, 지수 일반 자기회귀 조건부 이분산 과정과 정보 포착 자기회귀 조건부 이분간 과정임이 발견되었다. 이 중 비선형 일반 자기회귀 조건부 이분산 과정이 가장 좋은 모형으로 보인다. 비선형 일반 자기회귀 조건부 이분산 과정의 경우 예측오차의 승멱(power)이 약 1.5이다. 따라서 일반 자기회귀 조건부 이분산 과정의 예측오차의 승멱인 2에 비하여 작다. 이 사실은 일반 자기회귀 조건부 이분산의 예측오차의 승멱이 과도하게 측정되고 없음을 알 수 있다. 뉴스의 비대칭성과 규모를 반영하고 있는 모형들은 한결같이 예측오차의 크기에 적절한 가중치를 부여하여 예측오차의 크기를 조정하고 있다. 이 모형의 성질과 실증분석의 결과에 의하여 예측오차의 승멱은 2 이하로 수정하여 사용해야 한다는 점이 시사되고 있다. 음의 충격이 양의 충격보다 주가의 변동성을 크게 하고 없음이 발견되었다. 주가형성에 유리한 뉴스와 불리한 뉴스가 주가의 변동성에 미치는 영향의 차이와 충격의 중대성을 양으로 표시하는 규모의 차이를 반영해주는 변수들의 추정된 계수가 미국과 일본보다 절대값에 있어서 상당히 작다. 이 현상은 뉴스의 비대칭성과 규모보다는 발생하는 충격, 즉 뉴스 자체에 보다 민감하게 반응하고 있음을 보여주고 있다. 물론 투자자들이 뉴스의 비대칭성과 규모를 완전히 무시하고 투자활동을 전개하고 있다는 것을 의미하는 것은 아니다.

  • PDF

Comparison of Development Length Equation of Bottom and Top GFRP Bars with Splitting Failure (쪼갬파괴된 GFRP 하부근과 상부근의 정착길이 산정식 비교)

  • Ha, Sang-Su;Yoon, Joon-Sun
    • Journal of the Korea Institute of Building Construction
    • /
    • v.9 no.6
    • /
    • pp.141-149
    • /
    • 2009
  • The objective of this study was to propose a development length equation for bottom and top GFRP bars. Including the bottom and top GRPP bars, a total of 104 modified pullout tests were completed. The test variables were embedment length (15, 30, 45db), net cover thickness (0.5~2.0db), different GFRP bar types, and bar diameters (10, 13, 16mm). The average bond stresses were determined based on the modified pullout test results. Two variable linear regression analyses were performed on the results of the average bond stresses. Utilizing the 5% fractile concept, a conservative development length design equation was derived. The design equation of the development length for bottom and top GFRP bars was proposed and the design equation derived in this study was compared to the ACI 440.1R-06 committee equation.

Introduction to variational Bayes for high-dimensional linear and logistic regression models (고차원 선형 및 로지스틱 회귀모형에 대한 변분 베이즈 방법 소개)

  • Jang, Insong;Lee, Kyoungjae
    • The Korean Journal of Applied Statistics
    • /
    • v.35 no.3
    • /
    • pp.445-455
    • /
    • 2022
  • In this paper, we introduce existing Bayesian methods for high-dimensional sparse regression models and compare their performance in various simulation scenarios. Especially, we focus on the variational Bayes approach proposed by Ray and Szabó (2021), which enables scalable and accurate Bayesian inference. Based on simulated data sets from sparse high-dimensional linear regression models, we compare the variational Bayes approach with other Bayesian and frequentist methods. To check the practical performance of the variational Bayes in logistic regression models, a real data analysis is conducted using leukemia data set.

A Causation Study for car crashes at Rural 4-legged Signalized Intersections Using Nonlinear Regression and Structural Equation Methods (비선형 회귀분석과 구조방정식을 이용한 지방부 4지 신호교차로의 사고요인분석)

  • Oh, Ju Taek;Kweon, Ihl;Hwang, Jeong Won
    • Journal of Korean Society of Transportation
    • /
    • v.31 no.1
    • /
    • pp.65-76
    • /
    • 2013
  • Traffic accidents at signalized intersections have been increased annually so that it is required to examine the causation to reduce the accidents. However, the current existing accident models were developed mainly by using non-linear regression models such as Poisson methods. These non-linear regression methods lack to reveal the complicated causation for traffic accidents, though they are the right choice to study randomness and non-linearity of accidents. Therefore, it is required to utilize another statistical method to make up for the lack of the non-linear regression methods. This study developed accident prediction models for 4 legged signalized intersections with Poisson methods and compared them with structural equation models. This study used structural equation methods to reveal the complicated causation of traffic accidents, because the structural equation method has merits to explain more causational factors for accidents than others.

Long-Term Prediction of Prestress in Concrete Bridge by Nonlinear Regression Analysis Method (비선형 회귀분석기법을 이용한 콘크리트 교량 프리스트레스의 장기 예측)

  • Yang, In-Hwan
    • Journal of the Korea Concrete Institute
    • /
    • v.18 no.4 s.94
    • /
    • pp.507-515
    • /
    • 2006
  • The purpose of the paper is to propose a method to give a more accurate prediction of prestress changes in prestressed concrete(PSC) bridges. The statistical approach of the method is using the measurement data of the structural system to develop a nonlinear regression analysis. Long-term prediction of prestress is achieved using nonlinear regression analysis. The proposed method is applied to the prediction of prestress of an actual prestressed concrete box girder bridge. The present study represents that confidence interval of long-term prediction becomes progressively narrower with the increase of in-situ measurement data. Therefore, the numerical results prove that a more realistic long-term prediction of prestress changes in PSC structures can be achieved by employing the proposed method. The prediction results can be efficiently used to evaluate prestress during the service life of structure so that the remaining prestress exceeds the control criteria.

Estimating the Weight of Ginseng Using an Image Analysis (영상 분석을 이용한 수삼의 중량추정)

  • Jeong, Seokhoon;Ko, Kuk Won;Lee, Ji-Yeon;Lee, Jinho;Seo, Hyeonseok;Lee, Sangjoon
    • KIPS Transactions on Software and Data Engineering
    • /
    • v.5 no.7
    • /
    • pp.333-338
    • /
    • 2016
  • This study is to estimate proximity without direct measurement of the weight of fresh ginseng. For this work, we developed a ginseng image acquiring instrument and obtained 126 ginseng images using the instrument. Image analysis and parameter extraction process was used C language based Labwindows/CVI development tools and open source library OpenCV. Estimation formula is made by weighing the sample with image analysis of fresh ginseng. We analyzed the correlation between the pixel number and the weight of ginseng using a linear regression approach. It was obtained a strong positive correlation coefficient of 0.9162 with a linearity value.

Precision Enhancement of Summed Area Table using Linear Regression (선형 회귀분석을 이용한 합산 영역 테이블의 정밀도 향상)

  • Jeong, Juhyeon;Lee, Sungkil
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2013.05a
    • /
    • pp.386-388
    • /
    • 2013
  • 합산 영역 테이블(Summed Area Table)을 사용하면 현재 픽셀 주변으로 임의의 사각 영역의 평균을 모든 픽셀을 읽을 필요 없이, 단 4번의 픽셀의 합과 차로 표시할 수 있다. 그러나 많은 픽셀의 값이 누적되는 경우 부동소수점 표현의 정밀도가 떨어지는 문제가 발생한다. 따라서 본 논문에서는 합산 영역 테이블의 정밀도를 향상시키기 위한 방법으로 선형 회귀분석(linear regression)을 이용한 오프셋을 사용할 것을 제안한다. 회귀분석을 통해 구축한 다항식을 통해 픽셀 그리고 채널 별로 다른 오프셋을 적용하여 정밀도를 효과적으로 향상하였다.