• 제목/요약/키워드: Multivariate algorithm

검색결과 186건 처리시간 0.029초

매트릭스 프로파일을 이용한 제조 시계열 데이터 패턴 추출 (Pattern Extraction of Manufacturing Time Series Data Using Matrix Profile)

  • 김태현;진교홍
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2022년도 추계학술대회
    • /
    • pp.210-212
    • /
    • 2022
  • 제조업에서 생산 설비의 상태를 모니터링하기 위해 각종 센서를 부착하고 있으며, 이를 통해 획득된 데이터의 경우 시계열 데이터인 경우가 많다. 생산 설비의 이상 여부를 판단하기 위해서는시계열 데이터로부터 패턴을 추출하는 과정이 선행되어야 하며 다양한 방법이 연구되고 있다. 본 논문에서는 수집된 다변량 시계열 데이터로부터 패턴을 추출하기 위해 매트릭스 프로파일 알고리즘을 적용하였으며, 이를 통해 현재 CNC 머신으로부터 수집 중인 다중 센서 데이터의 패턴을 추출하였다.

  • PDF

Design and evaluation of artificial intelligence models for abnormal data detection and prediction

  • Hae-Jong Joo;Ho-Bin Song
    • Journal of Platform Technology
    • /
    • 제11권6호
    • /
    • pp.3-12
    • /
    • 2023
  • In today's system operation, it is difficult to detect failures and take immediate action in the case of a shortage of manpower compared to the number of equipment or failures in vulnerable time zones, which can lead to delays in failure recovery. In addition, various algorithms exist to detect abnormal symptom data, and it is important to select an appropriate algorithm for each problem. In this paper, an ensemble-based isolation forest model was used to efficiently detect multivariate point anomalies that deviated from the mean distribution in the data set generated to predict system failure and minimize service interruption. And since significant changes in memory space usage are observed together with changes in CPU usage, the problem is solved by using LSTM-Auto Encoder for a collective anomaly in which another feature exhibits an abnormal pattern according to a change in one by comparing two or more features. did In addition, evaluation indicators are set for the performance evaluation of the model presented in this study, and then AI model evaluation is performed.

  • PDF

매립물 특성 조사를 위한 다변량 통계분석 기법의 응용 (Application of Multivariate Statistical Analysis Technique in Landfill Investigation)

  • 권병두;김차섭
    • 한국지구과학회지
    • /
    • 제18권6호
    • /
    • pp.515-521
    • /
    • 1997
  • 난지도 매립장 매립물의 특성을 조사하기 위해서 중력, 자력, LandSat TM 열적외선 밴드 자료, 매립장의 표면에서 측정한 침하량 자료 등을 다변량 통계분석기법을 응용하여 분석하였다. 분석에 이용한 자료들은 각기 상이한 깊이에 관한 정보를 제공하기 때문에 측정된 총 자력자료와 중력자료는 자극화변환된 자력이상과 매립장의 3차원 밀도분포로 각기 전환하였으며, 본 연구에서는 이 중 매립장의 상부층에 관한 정보를 이용하였다. 통계분석은 침하량 측정 지점들을 대상으로 수행하였으며, 이들 지점에서의 자극화변환 자력이상, 매립물의 밀도, LandSat TM 열적외선 밴드 값들은 내삽방법을 이용하여 구하였다. 자료분석에 사용한 다변량 통계분석 기법은 개체간의 기하학적인 거리를 이용하여 군집화하는 집락분석으로, 개체간의 거리 계산시 각 자료간의 상이한 측정단위가 주는 효과를 제거하기 위해서 사전에 표준화를 실시하였다. 군집화는 체계적 군집화 방법을 이용하여 수행하였다. 물리적 특성을 바탕으로 분류된 최적의 군집수는 수상도에서 나타난 결과에 따르면 총 6개의 군집으로 나타났다. 본 연구의 결과는 통합된 지구물리자료에 다변량 통계분석 기법을 적용함으로써 복합적 인 쓰레기 매립장의 특성 규명이 가능함을 시사한다.

  • PDF

유전자 알고리즘을 이용한 트레이닝 최적화 기법 연구 - 정규분포를 고려한 통계적 영상분류의 경우 - (A Study on the Training Optimization Using Genetic Algorithm -In case of Statistical Classification considering Normal Distribution-)

  • 어양담;조봉환;이용웅;김용일
    • 대한원격탐사학회지
    • /
    • 제15권3호
    • /
    • pp.195-208
    • /
    • 1999
  • 위성영상 분류작업에서 분류클래스에 대한 샘플화소의 대표성은 분류 정확도에 많은 영향을 미친다. 따라서, 통계적 영상분류방법에서는 분류 기법 자체보다 분류 확률을 결정하는 트레이닝 단계, 즉 샘플화소의 최적화가 필요하다. 본 연구에서는 SPOT XS, LANDSAT TM을 이용한 위성영상 화소분류작업에서 분류 이전단계, 즉 샘플화소의 정규성을 계산하여, 정규성에 악영향을 미치는 화소를 객관적 기준으로 조정하였다. 정규화과정을 위한 유전자 알고리즘 적용의 생존확률 평가함수로 다변량 Q-Q plot의 상관계수와 트레이닝의 분산값을 고려하였으며, 5% 유의수준을 적용하였다. 연구결과, 실험대상지역의 경우, 유전자 알고리즘을 이용한 트레이닝 정규화 결과가 대부분의 클래스에 대하여 그 평균과 분산을 모집단에 근사시키고 있다는 것을 입증하였고, 해당 클래스의 모집단 분포를 예측할 수 있는 가능성을 제시하였다.

딥러닝 시계열 알고리즘 적용한 기업부도예측모형 유용성 검증 (Corporate Default Prediction Model Using Deep Learning Time Series Algorithm, RNN and LSTM)

  • 차성재;강정석
    • 지능정보연구
    • /
    • 제24권4호
    • /
    • pp.1-32
    • /
    • 2018
  • 본 연구는 경제적으로 국내에 큰 영향을 주었던 글로벌 금융위기를 기반으로 총 10년의 연간 기업데이터를 이용한다. 먼저 시대 변화 흐름에 일관성있는 부도 모형을 구축하는 것을 목표로 금융위기 이전(2000~2006년)의 데이터를 학습한다. 이후 매개 변수 튜닝을 통해 금융위기 기간이 포함(2007~2008년)된 유효성 검증 데이터가 학습데이터의 결과와 비슷한 양상을 보이고, 우수한 예측력을 가지도록 조정한다. 이후 학습 및 유효성 검증 데이터를 통합(2000~2008년)하여 유효성 검증 때와 같은 매개변수를 적용하여 모형을 재구축하고, 결과적으로 최종 학습된 모형을 기반으로 시험 데이터(2009년) 결과를 바탕으로 딥러닝 시계열 알고리즘 기반의 기업부도예측 모형이 유용함을 검증한다. 부도에 대한 정의는 Lee(2015) 연구와 동일하게 기업의 상장폐지 사유들 중 실적이 부진했던 경우를 부도로 선정한다. 독립변수의 경우, 기존 선행연구에서 이용되었던 재무비율 변수를 비롯한 기타 재무정보를 포함한다. 이후 최적의 변수군을 선별하는 방식으로 다변량 판별분석, 로짓 모형, 그리고 Lasso 회귀분석 모형을 이용한다. 기업부도예측 모형 방법론으로는 Altman(1968)이 제시했던 다중판별분석 모형, Ohlson(1980)이 제시한 로짓모형, 그리고 비시계열 기계학습 기반 부도예측모형과 딥러닝 시계열 알고리즘을 이용한다. 기업 데이터의 경우, '비선형적인 변수들', 변수들의 '다중 공선성 문제', 그리고 '데이터 수 부족'이란 한계점이 존재한다. 이에 로짓 모형은 '비선형성'을, Lasso 회귀분석 모형은 '다중 공선성 문제'를 해결하고, 가변적인 데이터 생성 방식을 이용하는 딥러닝 시계열 알고리즘을 접목함으로서 데이터 수가 부족한 점을 보완하여 연구를 진행한다. 현 정부를 비롯한 해외 정부에서는 4차 산업혁명을 통해 국가 및 사회의 시스템, 일상생활 전반을 아우르기 위해 힘쓰고 있다. 즉, 현재는 다양한 산업에 이르러 빅데이터를 이용한 딥러닝 연구가 활발히 진행되고 있지만, 금융 산업을 위한 연구분야는 아직도 미비하다. 따라서 이 연구는 기업 부도에 관하여 딥러닝 시계열 알고리즘 분석을 진행한 초기 논문으로서, 금융 데이터와 딥러닝 시계열 알고리즘을 접목한 연구를 시작하는 비 전공자에게 비교분석 자료로 쓰이기를 바란다.

권투 모션 인식을 위한 알고리즘 비교 연구 (A Study on Comparing algorithms for Boxing Motion Recognition)

  • 한창호;김순철;오춘석;유영기
    • 한국인터넷방송통신학회논문지
    • /
    • 제8권6호
    • /
    • pp.111-117
    • /
    • 2008
  • 본 논문은 권투 모션 인식에 대한 연구로서 게임이나, 애니메이션 등의 분야에 응용될 수 있다. 권투 모션의 인식을 위하여 주성분분석과 동적시간정합 알고리즘을 적용한 실험을 하여 비교 연구하였다. 주성분분석 이론은 인식하고자 하는 데이터의 차원을 축소하여 특정 벡터를 추출하여 비교하는 알고리즘이며, 동적시간정합은 두 순차적인 데이터의 유사성을 구하는 알고리즘이다. 모션 인식을 위해 두 상이한 알고리즘을 비교하여 성능을 고찰하고, 권투 모션을 구성하기 위해 만든 모션캡쳐 시스템을 소개한다. 구성된 권투 모션 데이터로부터 모션 그래프를 구성하고, 정규화 과정을 처리한 후, 각각 5명의 연기자의 모션에 대해 인식을 시도하여 실험을 통해 인식률 결과를 보여준다.

  • PDF

한강수질 평가를 위한 COD (화학적 산소 요구량) 모델 평가 (Chemical Oxygen Demand (COD) Model for the Assessment of Water Quality in the Han River, Korea)

  • Kim, Jae Hyoun;Jo, Jinnam
    • 한국환경보건학회지
    • /
    • 제42권4호
    • /
    • pp.280-292
    • /
    • 2016
  • Objectives: The objective of this study was to build COD regression models for the Han River and evaluate water quality. Methods: Water quality data sets for the dry season (as of January) during a four-year period (2012-2015) were collected from the database of the Han River automatic water quality monitoring stations. Statistical techniques, including combined genetic algorithm-multiple linear regression (GA-MLR) were used to build five-descriptor COD models. Multivariate statistical techniques such as principal component analysis (PCA) and cluster analysis (CA) are useful tools for extracting meaningful information. Results: The $r^2$ of the best COD models provided significant high values (> 0.8) between 2012 and 2015. Total organic carbon (TOC) was a surrogate indicator for COD (as COD/TOC) with high reliability ($r^2=0.63$ in 2012, $r^2=0.75$ for 2013, $r^2=0.79$ for 2014 and $r^2=0.85$ for 2015). The ratios of COD/TOC were calculated as 2.08 in 2012, 1.79 in 2013, 1.52 and 1.45 in 2015, indicating that biodegradability in the water body of the Han River was being sustained, thereby further improving water quality. The BOD/COD ratio supported these findings. The cluster analysis revealed higher annual levels of microorganisms and phosphorous at stations along the Hangang-Seoul and Hantangang areas. Nevertheless, the overall water quality over the last four years showed an observable trend toward continuous improvement. These findings also suggest that non-point pollution control strategies should consider the influence of upstreams and downstreams to protect water quality in the Han River. Conclusion: This data analysis procedure provided an efficient and comprehensive tool to interpret complex water quality data matrices. Results from a trend analysis provided much important information about sources and parameters for Han River water quality management.

선박 추진용 2행정 저속엔진의 고장모드 데이터 개발 및 LSTM 알고리즘을 활용한 특성인자 신뢰성 검증연구 (The Study of Failure Mode Data Development and Feature Parameter's Reliability Verification Using LSTM Algorithm for 2-Stroke Low Speed Engine for Ship's Propulsion)

  • 박재철;권혁찬;김철환;장화섭
    • 대한조선학회논문집
    • /
    • 제60권2호
    • /
    • pp.95-109
    • /
    • 2023
  • In the 4th industrial revolution, changes in the technological paradigm have had a direct impact on the maintenance system of ships. The 2-stroke low speed engine system integrates with the core equipment required for propulsive power. The Condition Based Management (CBM) is defined as a technology that predictive maintenance methods in existing calender-based or running time based maintenance systems by monitoring the condition of machinery and diagnosis/prognosis failures. In this study, we have established a framework for CBM technology development on our own, and are engaged in engineering-based failure analysis, data development and management, data feature analysis and pre-processing, and verified the reliability of failure mode DB using LSTM algorithms. We developed various simulated failure mode scenarios for 2-stroke low speed engine and researched to produce data on onshore basis test_beds. The analysis and pre-processing of normal and abnormal status data acquired through failure mode simulation experiment used various Exploratory Data Analysis (EDA) techniques to feature extract not only data on the performance and efficiency of 2-stroke low speed engine but also key feature data using multivariate statistical analysis. In addition, by developing an LSTM classification algorithm, we tried to verify the reliability of various failure mode data with time-series characteristics.

Noncontrast Computed Tomography-Based Radiomics Analysis in Discriminating Early Hematoma Expansion after Spontaneous Intracerebral Hemorrhage

  • Zuhua Song;Dajing Guo;Zhuoyue Tang;Huan Liu;Xin Li;Sha Luo;Xueying Yao;Wenlong Song;Junjie Song;Zhiming Zhou
    • Korean Journal of Radiology
    • /
    • 제22권3호
    • /
    • pp.415-424
    • /
    • 2021
  • Objective: To determine whether noncontrast computed tomography (NCCT) models based on multivariable, radiomics features, and machine learning (ML) algorithms could further improve the discrimination of early hematoma expansion (HE) in patients with spontaneous intracerebral hemorrhage (sICH). Materials and Methods: We retrospectively reviewed 261 patients with sICH who underwent initial NCCT within 6 hours of ictus and follow-up CT within 24 hours after initial NCCT, between April 2011 and March 2019. The clinical characteristics, imaging signs and radiomics features extracted from the initial NCCT images were used to construct models to discriminate early HE. A clinical-radiologic model was constructed using a multivariate logistic regression (LR) analysis. Radiomics models, a radiomics-radiologic model, and a combined model were constructed in the training cohort (n = 182) and independently verified in the validation cohort (n = 79). Receiver operating characteristic analysis and the area under the curve (AUC) were used to evaluate the discriminative power. Results: The AUC of the clinical-radiologic model for discriminating early HE was 0.766. The AUCs of the radiomics model for discriminating early HE built using the LR algorithm in the training and validation cohorts were 0.926 and 0.850, respectively. The AUCs of the radiomics-radiologic model in the training and validation cohorts were 0.946 and 0.867, respectively. The AUCs of the combined model in the training and validation cohorts were 0.960 and 0.867, respectively. Conclusion: NCCT models based on multivariable, radiomics features and ML algorithm could improve the discrimination of early HE. The combined model was the best recommended model to identify sICH patients at risk of early HE.

Reagentless Determination of Human Serum Components Using Infrared Absorption Spectroscopy

  • Hahn, Sang-Joon;Yoon, Gil-Won;Kim Gun-Shik;Park Seung-Han
    • Journal of the Optical Society of Korea
    • /
    • 제7권4호
    • /
    • pp.240-244
    • /
    • 2003
  • Simultaneous determination of concentrations for four major components in human blood serum was investigated using a Fourier-transform mid-infrared spectroscopy. Infrared spectra of human blood serum were measured in 8.404 ∼ 10.25 ${\mu}m$ range where the highest absorption peaks of glucose are located. A partial least square (PLS) algorithm was utilized to establish a calibration model for determining total protein, albumin, globulin and glucose levels which are commonly measured metabolites. The standard error of cross validation obtained from our multivariate calibration model was 0.24 g/dL for total protein, 0.15 g/dL for albumin, 0.17 g/dL for globulin, and 6.68 mg/dL for glucose, which are comparable with or meet the criteria for clinical use. The results indicate that the infrared absorption spectroscopy can be used to predict the concentrations of clinically important metabolites without going through a chemical process with a reagent.