• 제목/요약/키워드: SVM Model

검색결과 702건 처리시간 0.024초

시뮬레이티드 어니일링 기반의 랜덤 포레스트를 이용한 기업부도예측 (Predicting Corporate Bankruptcy using Simulated Annealing-based Random Fores)

  • 박호연;김경재
    • 지능정보연구
    • /
    • 제24권4호
    • /
    • pp.155-170
    • /
    • 2018
  • 기업의 금융 부도를 예측하는 것은 전통적으로 비즈니스 분석에서 가장 중요한 예측문제 중 하나이다. 선행연구에서 예측모델은 통계 및 기계학습 기반의 기법을 적용하거나 결합하는 방식으로 제안되었다. 본 논문에서는 잘 알려진 최적화기법 중 하나인 시뮬레이티드 어니일링에 기반한 새로운 지능형 예측모델을 제안한다. 시뮬레이티드 어니일링은 유전자알고리즘과 유사한 최적화 성능을 가진 것으로 알려져 있다. 그럼에도 불구하고, 시뮬레이티드 어니일링을 사용한 비즈니스 의사결정 문제의 예측과 분류에 관한 연구가 거의 없었기 때문에, 비즈니스 분석에서의 유용성을 확인하는 것은 의미가 있다. 본 연구에서는 시뮬레이티드 어니일링과 기계학습의 결합 모델을 사용하여 부도예측모델의 입력 특징을 선정한다. 최적화 기법과 기계학습기법을 결합하는 대표적인 유형은 특징 선택, 특징 가중치 및 사례 선택이다. 이 연구에서는 선행연구에서 가장 많이 연구된 특징 선택을 위한 결합모델을 제안한다. 제안하는 모델의 우수성을 확인하기 위하여 본 연구에서는 한국 기업의 실제 재무데이터를 이용하여 그 결과를 분석한다. 분석결과는 제안된 모델의 예측 정확도가 단순한 모델의 예측 정확성보다 우수하다는 것을 보여준다. 특히 기존의 의사결정나무, 랜덤포레스트, 인공신경망, SVM 및 로지스틱 회귀분석에 비해 분류성능이 향상되었다.

감성분석을 이용한 뉴스정보와 딥러닝 기반의 암호화폐 수익률 변동 예측을 위한 통합모형 (An Integrated Model for Predicting Changes in Cryptocurrency Return Based on News Sentiment Analysis and Deep Learning)

  • 김은미
    • 지식경영연구
    • /
    • 제22권2호
    • /
    • pp.19-32
    • /
    • 2021
  • 암호화폐 중 대표적인 비트코인은 전 세계적으로 많은 관심을 받고 있으며 비트코인의 가격은 등·하락을 거듭하며 높은 변동성을 보이고 있다. 높은 변동성은 투자자들에게 위험 요인으로 작용하며 무분별한 투자로 인한 사회적 문제를 야기시킨다. 비트코인의 가격은 세계의 환경변화에 영향을 받으며 신속하게 반응하기 때문에 실시간으로 다양한 정보를 제공하는 뉴스 정보는 비트코인 가격의 변동성 예측에 유용한 정보를 제공한다. 즉, 긍정적인 뉴스는 투자심리를 자극할 것이며 반대로 부정적인 뉴스는 투자심리를 위축시킬 것이다. 따라서 본 연구에서는 비트코인의 수익률 변동을 예측하기 위해 뉴스의 감성정보와 딥러닝을 적용하였다. 로짓, 인공신경망, SVM, LSTM을 적용하여 단일 예측모형을 구축하였으며 예측성과를 향상시키기 위한 방법으로 통합모형을 제안하였다. 과거의 가격정보를 기반으로 구축한 예측모형과 뉴스의 감성정보를 반영한 예측모형의 성과를 비교한 결과 뉴스의 감성정보를 반영한 예측모형의 성과가 우수하게 나타났으며 통합모형의 성과가 가장 우수한 것으로 나타났다. 본 연구는 비트코인 수익률 변동에 대한 예측모형을 통해 무분별한 투자를 예방하고 투자자들의 현명한 투자가 이루어질 수 있도록 유용한 정보를 제공할 수 있을 것이다.

Finding Unexpected Test Accuracy by Cross Validation in Machine Learning

  • Yoon, Hoijin
    • International Journal of Computer Science & Network Security
    • /
    • 제21권12spc호
    • /
    • pp.549-555
    • /
    • 2021
  • Machine Learning(ML) splits data into 3 parts, which are usually 60% for training, 20% for validation, and 20% for testing. It just splits quantitatively instead of selecting each set of data by a criterion, which is very important concept for the adequacy of test data. ML measures a model's accuracy by applying a set of validation data, and revises the model until the validation accuracy reaches on a certain level. After the validation process, the complete model is tested with the set of test data, which are not seen by the model yet. If the set of test data covers the model's attributes well, the test accuracy will be close to the validation accuracy of the model. To make sure that ML's set of test data works adequately, we design an experiment and see if the test accuracy of model is always close to its validation adequacy as expected. The experiment builds 100 different SVM models for each of six data sets published in UCI ML repository. From the test accuracy and its validation accuracy of 600 cases, we find some unexpected cases, where the test accuracy is very different from its validation accuracy. Consequently, it is not always true that ML's set of test data is adequate to assure a model's quality.

A Novel Classification Model for Employees Turnover Using Neural Network for Enhancing Job Satisfaction in Organizations

  • Tarig Mohamed Ahmed
    • International Journal of Computer Science & Network Security
    • /
    • 제23권7호
    • /
    • pp.71-78
    • /
    • 2023
  • Employee turnover is one of the most important challenges facing modern organizations. It causes job experiences and skills such as distinguished faculty members in universities, rare-specialized doctors, innovative engineers, and senior administrators. HR analytics has enhanced the area of data analytics to an extent that institutions can figure out their employees' characteristics; where inaccuracy leads to incorrect decision making. This paper aims to develop a novel model that can help decision-makers to classify the problem of Employee Turnover. By using feature selection methods: Information Gain and Chi-Square, the most important four features have been extracted from the dataset. These features are over time, job level, salary, and years in the organization. As one of the important results of this research, these features should be planned carefully to keep organizations their employees as valuable assets. The proposed model based on machine learning algorithms. Classification algorithms were used to implement the model such as Decision Tree, SVM, Random Frost, Neuronal Network, and Naive Bayes. The model was trained and tested by using a dataset that consists of 1470 records and 25 features. To develop the research model, many experiments had been conducted to find the best one. Based on implementation results, the Neural Network algorithm is selected as the best one with an Accuracy of 84 percents and AUC (ROC) 74 percents. By validation mechanism, the model is acceptable and reliable to help origination decision-makers to manage their employees in a good manner.

보행자-차량 충돌사고 특성분석 방법론 비교 연구 (Comparison of Methodologies for Characterizing Pedestrian-Vehicle Collisions)

  • 최새로나;정은비;오철
    • 대한교통학회지
    • /
    • 제31권6호
    • /
    • pp.53-66
    • /
    • 2013
  • 최근 운전자의 보행자-차량 충돌사고 감소를 목적으로 한 다양한 연구가 수행되고 있으며, 본 연구에서는 보행자-차량 사고 발생 특성 및 심각도 영향요인 분석을 위하여 다양한 분석방법론을 활용한 보행자 교통사고 분석을 수행하였다. 통계모형과 휴리스틱모형 적용시 각 기법에 따른 결과를 도출함으로써 보행자 사고분석시 분석목적에 적합한 방법론을 제시하는 것을 목적으로 하였다. 이를 위하여 최근 3년간 발생한 경기도 교통사고자료(2008-2010년)를 활용하여 보행자 교통사고의 발생특성을 분석하였다. 또한, 통계모형인 이항 로지스틱 회귀분석, 순서형 프로빗 모형을 이용하여 보행자 교통사고 심각도 증가에 통계적으로 유의한 영향을 미치는 변수를 도출하였으며, 휴리스틱모형인 서포트 벡터 머신, 의사결정나무를 적용하여 교통사고 심각도 분류를 위한 모형을 개발하고 그 결과를 비교분석 하였다. 본 연구의 분석결과는 보행자 교통안전분석의 기초자료로 활용할 수 있으며 향후 국내 보행자-차량 충돌사고 분석시 유용하게 활용될 수 있을 것으로 기대된다.

SVM과 로짓회귀분석을 이용한 흥미있는 웹페이지 예측 (Predicting Interesting Web Pages by SVM and Logit-regression)

  • 전도홍;김형래
    • 한국컴퓨터정보학회논문지
    • /
    • 제20권3호
    • /
    • pp.47-56
    • /
    • 2015
  • 흥미 있는 웹페이지의 자동화된 탐색은 다양한 응용 분야에 활용될 수 있다. 웹페이지에 대한 사용자의 흥미는 판단하는 것은 사용자의 행동을 관찰함으로 자동화가 가능하다. 흥미 있는 웹페이지를 구분하는 작업은 판별 문제에 속하며, 우리는 실증을 위해 화이트 박스의 학습 방법(로짓회귀분석, 지지기반학습)을 선택한다. 실험 결과는 다음을 나타내었다. (1) 고정효과 로짓회귀분석, polynomial 과 radial 커널을 이용한 고정효과 지지기반학습은 선형 커널보다 높은 성능을 보였다. (2) 개인화가 모델 성능을 향상시킴에 있어 주요한 이슈이다. (3) 사용자에게 웹페이지에 대항 흥미를 물을 때, 구간은 단순히 예/아니 도 충분할 수 있다. (4) 웹페이지에 머문 기간이 매초 증가할 때마다 성공확률은 1.004배 증가하며, 하지만 스크롤바 클릭 수 (p=0.56) 와 마우스 클릭 수 (p=0.36) 지표는 흥미와 통계적으로 유의한 관계를 가지지 않았다.

No-reference Image Quality Assessment With A Gradient-induced Dictionary

  • Li, Leida;Wu, Dong;Wu, Jinjian;Qian, Jiansheng;Chen, Beijing
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제10권1호
    • /
    • pp.288-307
    • /
    • 2016
  • Image distortions are typically characterized by degradations of structures. Dictionaries learned from natural images can capture the underlying structures in images, which are important for image quality assessment (IQA). This paper presents a general-purpose no-reference image quality metric using a GRadient-Induced Dictionary (GRID). A dictionary is first constructed based on gradients of natural images using K-means clustering. Then image features are extracted using the dictionary based on Euclidean-norm coding and max-pooling. A distortion classification model and several distortion-specific quality regression models are trained using the support vector machine (SVM) by combining image features with distortion types and subjective scores, respectively. To evaluate the quality of a test image, the distortion classification model is used to determine the probabilities that the image belongs to different kinds of distortions, while the regression models are used to predict the corresponding distortion-specific quality scores. Finally, an overall quality score is computed as the probability-weighted distortion-specific quality scores. The proposed metric can evaluate image quality accurately and efficiently using a small dictionary. The performance of the proposed method is verified on public image quality databases. Experimental results demonstrate that the proposed metric can generate quality scores highly consistent with human perception, and it outperforms the state-of-the-arts.

새로운 얼굴 특징공간을 이용한 모델 기반 얼굴 표정 인식 (Model based Facial Expression Recognition using New Feature Space)

  • 김진옥
    • 정보처리학회논문지B
    • /
    • 제17B권4호
    • /
    • pp.309-316
    • /
    • 2010
  • 본 연구에서는 얼굴 그리드 각도를 특징공간으로 하는 새로운 모델 기반 얼굴 표정 인식 방법을 제안한다. 제안 방식은 6가지 얼굴 대표 표정을 인식하기 위해 표정 그리드를 이용하여 그리드의 각 간선과 정점이 형성하는 각도를 기반으로 얼굴 특징 공간을 구성한다. 이 방법은 다른 표정 인식 알고리즘의 정확도를 낮추는 원인인 변환, 회전, 크기변화와 같은 어파인 변환에 강건한 특징을 보인다. 또한, 본 연구에서는 각도로 특징공간을 구성하고 이 공간 내에서 Wrapper 방식으로 특징 부분집합을 선택하는 과정을 설명한다. 선택한 특징들은 SVM, 3-NN 분류기를 이용해 분류하고 분류 결과는 2중 교차검증을 통해 검증하도록 한다. 본 연구가 제안한 방법에서는 94%의 표정 인식 결과를 보였으며 특히 특징 부분집합 선택 알고리즘을 적용한 결과 전체 특징을 이용한 경우보다 약 10%의 인식율 개선 효과를 보인다.

DEA를 적용한 문화관광축제의 효율성 등급 예측모형 (The Efficiency Rating Prediction for Cultural Tourism Festival Based of DEA)

  • 김은미;홍태호
    • 한국정보시스템학회지:정보시스템연구
    • /
    • 제29권3호
    • /
    • pp.145-157
    • /
    • 2020
  • Purpose This study proposed an approach for predicting the efficiency rating of the cultural tourism festivals using DEA and machine learning techniques. The cultural tourism festivals are selected for the best festivals through peer reviews by tourism experts. However, only 10% of the festivals which are held in a year could be evaluated in the view of effectiveness without considering the efficiency of festivals. Design/methodology/approach Efficiency scores were derived from the results of DEA for the prediction of efficiency ratings. This study utilized BCC models to reflect the size effect of festivals and classified the festivals into four ratings according the efficiency scores. Multi-classification method were considered to build the prediction of four ratings for the festivals in this study. We utilized neural networks and SVMs with OAO(one-against-one), OAR(one-against-rest), C&S(crammer & singer) with Korea festival data from 2013 to 2018. Findings The number of total visitors in low efficient rating of DEA is more larger than the number of total visitors in high efficient ratings although the total expenditure of visitors is the highest in the most efficient rating when we analyzed the results of DEA for the characteristics of four ratings. SVM with OAO model showed the most superior performance in accuracy as SVM with OAR model was not trained well because of the imbalanced distribution between efficient rating and the other ratings. Our approach could predict the efficiency of festivals which were not included in the review process of culture tourism festivals without rebuilding DEA models each time. This enables us to manage the festivals efficiently with the proposed machine learning models.

배경모델링과 CNN을 이용한 실시간 피플 카운팅 알고리즘 (A Real-time People Counting Algorithm Using Background Modeling and CNN)

  • 양훈준;장혁;정재협;이보원;정동석
    • 전자공학회논문지
    • /
    • 제54권3호
    • /
    • pp.70-77
    • /
    • 2017
  • 최근 IoT 및 딥러닝 관련 기술요소들이 영상보안감시시스템에서도 다양하게 응용되고 있다. 그 중 CCTV를 통해 촬영된 동영상에서 자동으로 특정 객체를 검출, 추적, 분류 하는 감시 기능이 점점 지능화되고 있다. 본 논문에서는 보급형 CPU만 사용하는 PC 환경에서도 실시간 처리가 가능한 알고리즘을 목표로 하였다. GMM(Gaussian Mixture Model)을 이용한 배경 모델링과 헝가리안 알고리즘, 그리고 칼만 필터를 조합한 추적 알고리즘은 전통적이며 복잡도가 비교적 적지만 검출 오류가 높다. 이를 보강하기 위해 대용량 데이터 학습에 적합한 딥러닝을 기술을 적용하였다. 특히 움직임이 있는 사람의 특징을 강조하기 위해 추적된 객체에 대해 SRGB-3 Layer CNN을 사용하였다. 성능 평가를 위해 기존의 HOG와 SVM을 이용한 시스템과 비교했을 때 Move-in은 7.6%, Move-out은 9.0%의 오류율 감소가 있었다.