• 제목/요약/키워드: Variance Inflation Factors

검색결과 18건 처리시간 0.019초

Tests for homogeneity of proportions in clustered binomial data

  • Jeong, Kwang Mo
    • Communications for Statistical Applications and Methods
    • /
    • 제23권5호
    • /
    • pp.433-444
    • /
    • 2016
  • When we observe binary responses in a cluster (such as rat lab-subjects), they are usually correlated to each other. In clustered binomial counts, the independence assumption is violated and we encounter an extra-variation. In the presence of extra-variation, the ordinary statistical analyses of binomial data are inappropriate to apply. In testing the homogeneity of proportions between several treatment groups, the classical Pearson chi-squared test has a severe flaw in the control of Type I error rates. We focus on modifying the chi-squared statistic by incorporating variance inflation factors. We suggest a method to adjust data in terms of dispersion estimate based on a quasi-likelihood model. We explain the testing procedure via an illustrative example as well as compare the performance of a modified chi-squared test with competitive statistics through a Monte Carlo study.

머신러닝 기반 피싱 사이트 탐지 모델 (Machine Learning-based Phishing Website Detection Model)

  • 오수민;박민서
    • 문화기술의 융합
    • /
    • 제10권4호
    • /
    • pp.575-580
    • /
    • 2024
  • 소셜 미디어의 대중화로 지능화된 피싱 공격을 방어하기 위해 접근하고자 하는 사이트의 상태(정상/피싱)를 판별하는 것이 필요하다. 본 연구에서는 머신러닝 기반 분류 모델을 통해 사이트의 정상/피싱 여부를 예측하는 모델을 제안한다. 첫째, 'URL'에 대한 정보를 수집하여 수치 데이터로 변환한 후, 이상치를 제거한다. 둘째, 변수들 간의 상관관계 및 독립성을 파악하기 위해 VIF(Variance Inflation Factors)를 적용한다. 셋째, 머신러닝 기반 분류 모델을 활용하여 피싱 사이트 탐지 모델을 개발하고, 이를 통해 사이트의 상태를 예측한다. 분류 모델 중 랜덤 포레스트(Random Forest)의 성능이 가장 우수했으며, 테스트 데이터에서 정밀도(Precision) 93.74%, 재현율(Recall) 92.26%, 정확도(Accuracy) 93.14%를 보였다. 향후 이 연구는 다방면의 피싱 범죄 탐지에 적용할 수 있을 것으로 기대된다.

중고 벌크선의 가격결정요인 선정에 관한 연구 (A Study on the Selection of Pricing Factors for Used Bulk Carriers)

  • 양윤옥
    • 한국항해항만학회지
    • /
    • 제41권4호
    • /
    • pp.181-188
    • /
    • 2017
  • 기존 선박매매시장에서 선박가격은 최근 거래되는 비슷한 유형의 선박가격을 기반으로 산정되었다. 하지만 2008년 금융위기 이후 선박가격 변동이 심해지면서 선박 내재적 가치를 산정할 수 있는 선박가격평가기준이 필요하다. 본 연구에서는 선박의 내재된 요소를 추정하기 위해 헤도닉가격모형을 사용하였다. 이에 본 연구는 헤도닉가격모형을 이용하여 선박가격에 미치는 영향을 각 특성별 가치를 분석하고 추정모형을 도출하였다. 헤도닉가격모형에서 제시된 4가지 모형들 중에 분산확대인자와 단계선택방식으로 최적의 모형을 선정하였다. 이를 위해 실제 거래된 선박과 특성자료를 활용하여 선박가격에 미치는 결정변수들의 영향력 정도를 분석하였다. 최종 선정된 모형은 Log-Line모형으로 회귀분석결과 DWT, Age, Market Value, Short-Term Charter, Long-Term Charter, Enbloc, Special Survey Due, Builder 8개의 변수가 선박가격모형에 영향을 미치는 것으로 나타났다. 제시한 선박가격모형은 선박가격을 평가할 때 객관적이고 균형있는 의사결정을 하는데 도움이 될 것이다.

머신러닝 기반 외식업 프랜차이즈 가맹점 성패 예측 (Prediction of Food Franchise Success and Failure Based on Machine Learning)

  • 안예린;유성민;이현희;박민서
    • 문화기술의 융합
    • /
    • 제8권4호
    • /
    • pp.347-353
    • /
    • 2022
  • 외식업은 소비자의 수요가 많고 진입장벽이 낮아 창업이 활발하게 일어난다. 하지만 외식업은 폐업률이 높고, 프랜차이즈의 경우 동일 브랜드 내에서도 매출 편차가 크게 나타난다. 따라서 외식업 프랜차이즈의 폐업을 방지하기 위한 연구가 필요하다. 이를 위해, 본 연구에서는 프랜차이즈 가맹점 매출에 영향을 미치는 요인들을 살펴보고, 도출된 요인들에 머신러닝 기법을 활용하여 프랜차이즈의 성패를 예측하고자 한다. 강남구 프랜차이즈 매장의 PoS(Point of Sale) 데이터와 공공데이터를 활용하여 가맹점 매출에 영향을 미치는 여러 요인들을 추출하고, VIF(Variance Inflation Factor)를 활용하여 다중공산성을 제거하여 타당성 있는 변수 선택을 진행한 뒤, 머신러닝 기법 중 분류모델을 활용하여 프랜차이즈 매장의 성패 예측을 진행한다. 이를 통해 최고 정확도 0.92를 가진 프랜차이즈 성패 예측 모델을 제안한다.

진단 초음파 검사자의 작업 관련 근골격계질환 연구 (A Study on Work-Related Musculoskeletal Disorders Related to Sonographer's)

  • 안현
    • 대한방사선기술학회지:방사선기술과학
    • /
    • 제45권4호
    • /
    • pp.355-363
    • /
    • 2022
  • This study was to investigate the prevalence rate of musculoskeletal disorders in relation to general characteristic factors, living environment factors, and work environment factors for sonographer's. For the response questions, the guidelines for musculoskeletal burden work were used. For statistical analysis, SPSS 26.0 version was used. For the common body parts of the sonographer's who responded, the prevalence was investigated by dividing the group into a group with high pain or discomfort and a group with low pain or discomfort according to the degree to which they experienced symptoms during the past 12 months. Multiple logistic regression analysis was used to determine the variance inflation factor(VIF), odds ratio (OR) and corresponding 95% confidence interval (CI). A p-value of <0.05 was considered statistically significant. As a result, housework hours, examination history, regular physical activity, number of patient examinations per day, and sitting posture were investigated as variables for rate musculoskeletal disorders. The sonographer's occupational group was found to have a high prevalence rate of musculoskeletal disorders like various other occupational groups. Based on the results of this study, it is judged that musculoskeletal disorders can be reduced by recognizing musculoskeletal disorders and improving work environment factors.

능형회귀분석을 활용한 부동산 헤도닉 가격모형의 정확성 및 해석력 향상에 관한 연구 - 서울시 구로구 아파트를 대상으로 - (Using Ridge Regression to Improve the Accuracy and Interpretation of the Hedonic Pricing Model : Focusing on apartments in Guro-gu, Seoul)

  • 구본상;신병진
    • 한국건설관리학회논문집
    • /
    • 제16권5호
    • /
    • pp.77-85
    • /
    • 2015
  • 헤도닉 가격 모형은 부동산 가격에 영향을 미치는 여러 요소를 모델링하는데 활용되는 대표적 방법이다. 부동산 가격은 전용면적, 방의 개수, 주차공간과 같은 내재적 속성 뿐 아니라 주변 선호/비선호시설의 존재여부에 따라 영향을 받는다. 주변 입지시설의 경우, 그 영향을 파악하기 위해서는 해당 부동산과의 인접거리를 설명변수로 사용하게 된다. 그러나 다수의 입지시설이 인접해 있는 경우에는 설명 변수 간 다중공선성이 발생하는 문제가 존재한다. 본 연구에서는 분산팽창지수 및 능형회귀분석을 이용해 다중공선성을 파악하고 유의한 설명변수를 선별하는데에 활용하였다. 이들 기법을 서울시 구로구 아파트들에 적용한 결과, 전철 차량 기지, 디지털 단지 및 위도에 해당하는 변수간의 다중공선성을 파악하였으며, 능형회귀분석을 통해 적합한 변수들을 체계적으로 선정할 수 있었다. 본 사례를 통해 상기 기법들이 더 정확하고 적정한 헤도닉 가격 모형을 구축하는데 중요한 보완적 기능을 해준다는 것을 알 수 있다.

방화 발생에 영향을 미치는 요인에 관한 연구 (A Study on the Factors Affecting the Arson)

  • 김영철;박우성;이수경
    • 한국화재소방학회논문지
    • /
    • 제28권2호
    • /
    • pp.69-75
    • /
    • 2014
  • 본 연구에서는 방화발생에 영향을 미치는 요인을 도출하기 위하여 발생건수를 종속변수로 하고 경제 인구 사회적 요인을 독립변수로 하는 다중회귀분석을 실시하였다. 다중회귀분석은 선형함수, 준로그함수, 역준로그함수, 이중로그함수 4가지 함수형태에 대해 적용하였으며, 각 단계별로 변수의 선택과 제외를 고려하는 단계적선택 방식을 적용하였다. 다중공선성 문제와 자기상관 문제를 해결하기 위하여 분산확대지수(VIF)와 Durbin-Watson 계수 이용하였으며, 4가지 함수모형에 대하여 수정된 R 제곱(설명력) 값이 0.935 (93.5%)로 가장 값이 높고 통계적으로 유의한 선형함수모형을 최적의 모형으로 결정하고 모형에 대한 해석을 진행하였다. 선형함수모형 결과 방화발생에 영향을 미치는 요인은 범죄발생건수(0.829), 일반이혼율(0.151), 재정자주도(0.149), 소비자물가상승률(0.099) 순으로 도출되었다.

An Analysis of Factors Relating to Agricultural Machinery Farm-Work Accidents Using Logistic Regression

  • Kim, Byounggap;Yum, Sunghyun;Kim, Yu-Yong;Yun, Namkyu;Shin, Seung-Yeoub;You, Seokcheol
    • Journal of Biosystems Engineering
    • /
    • 제39권3호
    • /
    • pp.151-157
    • /
    • 2014
  • Purpose: In order to develop strategies to prevent farm-work accidents relating to agricultural machinery, influential factors were examined in this paper. The effects of these factors were quantified using logistic regression. Methods: Based on the results of a survey on farm-work accidents conducted by the National Academy of Agricultural Science, 21 tentative independent variables were selected. To apply these variables to regression, the presence of multicollinearity was examined by comparing correlation coefficients, checking the statistical significance of the coefficients in a simple linear regression model, and calculating the variance inflation factor. A logistic regression model and determination method of its goodness of fit was defined. Results: Among 21 independent variables, 13 variables were not collinear each other. The results of a logistic regression analysis using these variables showed that the model was significant and acceptable, with deviance of 714.053. Parameter estimation results showed that four variables (age, power tiller ownership, cognizance of the government's safety policy, and consciousness of safety) were significant. The logistic regression model predicted that the former two increased accident odds by 1.027 and 8.506 times, respectively, while the latter two decreased the odds by 0.243 and 0.545 times, respectively. Conclusions: Prevention strategies against factors causing an accident, such as the age of farmers and the use of a power tiller, are necessary. In addition, more efficient trainings to elevate the farmer's consciousness about safety must be provided.

분포형 CN 기반 토지피복별 유출가중치를 이용한 오염부하량 능형회귀모형 개발 (Development of Ridge Regression Model of Pollutant Load Using Runoff Weighted Value Based on Distributed Curve-Number)

  • 송철민;김진수
    • 한국농공학회논문집
    • /
    • 제60권1호
    • /
    • pp.111-120
    • /
    • 2018
  • The purpose of this study was to develop a ridge regression (RR) model to estimate BOD and TP load using runoff weighted value. The concept of runoff weighted value, based on distributed curve-number (CN), was introduced to reflect the impact of land covers on runoff. The estimated runoff depths by distributed CN were closer to the observed values than those by area weighted mean CN. The RR is a technique used when the data suffers from multicollinearity. The RR model was developed for five flow duration intervals with the independent variables of daily runoff discharge of seven land covers and dependent variables of daily pollutant load. The RR model was applied to Heuk river watershed, a subwatershed of the Han river watershed. The variance inflation factors of the RR model decreased to the value less than 10. The RR model showed a good performance with Nash-Sutcliffe efficiency (NSE) of 0.73 and 0.87, and Pearson correlation coefficient of 0.88 and 0.93 for BOD and TP, respectively. The results suggest that the methods used in the study can be applied to estimate pollutant load of different land cover watersheds using limited data.

HIV-related Perceptions, Knowledge, Professional Ethics, Institutional Support, and HIV/AIDS-related Stigma in Health Services in West Sumatra, Indonesia: An Empirical Evaluation Using PLS-SEM

  • Vivi Triana;Nursyirwan Effendi;Brian Sri Pra Hastuti;Cimi Ilmiawati;Dodi Devianto;Afrizal Afrizal;Adang Bachtiar;Rima Semiarty;Raveinal Raveinal
    • Journal of Preventive Medicine and Public Health
    • /
    • 제57권5호
    • /
    • pp.435-442
    • /
    • 2024
  • Objectives: The aim of this study was to investigate the significance of associations between knowledge, professional ethics, institutional support, perceptions regarding HIV/AIDS, and HIV/AIDS-related stigma among health workers in West Sumatra, Indonesia. Methods: We conducted a cross-sectional study involving health workers at public hospitals and health centers in West Sumatra in June 2022. The Health Care Provider HIV/AIDS Stigma Scale was employed to assess the stigma associated with HIV/AIDS. To estimate and evaluate the model's ability to explain the proposed constructs, we utilized the standardized partial least squares structural equation model (PLS-SEM). Results: In total, 283 individuals participated in this study (average age, 39 years). The majority were female (91.2%), nearly half were nurses (49.5%), and 59.4% had been working for more than 10 years. The study revealed that HIV/AIDS-related stigma persisted among health workers. The PLS-SEM results indicated that all latent variables had variance inflation factors below 5, confirming that they could be retained in the model. Knowledge and professional ethics significantly contributed to human immunodeficiency virus (HIV)-related stigma, with an effect size (f2) of 0.15 or greater. In contrast, perceived and institutional support had a smaller impact on HIV-related stigma, with an effect size (f2) of at least 0.02. The R2 value for health worker stigma was 0.408, suggesting that knowledge, professional ethics, institutional support, and perceived support collectively explain 40.8% of the variance in stigma. Conclusions: Improving health workers' understanding of HIV, fostering professional ethics, and strengthening institutional support are essential for reducing HIV-related stigma in this population.