• 제목/요약/키워드: High Dimensionality Data

검색결과 121건 처리시간 0.029초

펴지추론과 다항식에 기초한 활성노드를 가진 자기구성네트윅크 (Self-organizing Networks with Activation Nodes Based on Fuzzy Inference and Polynomial Function)

  • 김동원;오성권
    • 제어로봇시스템학회:학술대회논문집
    • /
    • 제어로봇시스템학회 2000년도 제15차 학술회의논문집
    • /
    • pp.15-15
    • /
    • 2000
  • In the past couple of years, there has been increasing interest in the fusion of neural networks and fuzzy logic. Most of the existing fused models have been proposed to implement different types of fuzzy reasoning mechanisms and inevitably they suffer from the dimensionality problem when dealing with complex real-world problem. To overcome the problem, we propose the self-organizing networks with activation nodes based on fuzzy inference and polynomial function. The proposed model consists of two parts, one is fuzzy nodes which each node is operated as a small fuzzy system with fuzzy implication rules, and its fuzzy system operates with Gaussian or triangular MF in Premise part and constant or regression polynomials in consequence part. the other is polynomial nodes which several types of high-order polynomials such as linear, quadratic, and cubic form are used and are connected as various kinds of multi-variable inputs. To demonstrate the effectiveness of the proposed method, time series data for gas furnace process has been applied.

  • PDF

Relational Discriminant Analysis를 이용한 고차원 영상패턴의 차원축소 (A Dimension Reduction Method for High-Dimensional Image Patterns Using Relational Discriminant Analysis)

  • 김상운;구범용
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2006년도 하계종합학술대회
    • /
    • pp.689-690
    • /
    • 2006
  • Relational discriminant analysis is a way of representing an object based on the dissimilarity measures among the prototypes extracted from feature vectors instead of the vectors themselves. Thus, by appropriately selecting a few number of representatives and by defining the dissimilarity measure, in this paper we propose a method of reducing the dimensionality and getting to achieve a better classification performance in both speed and accuracy. Our experimental results demonstrate that the proposed mechanism increases the performance as compared with the conventional approaches for samples involving artificial data sets.

  • PDF

A concise overview of principal support vector machines and its generalization

  • Jungmin Shin;Seung Jun Shin
    • Communications for Statistical Applications and Methods
    • /
    • 제31권2호
    • /
    • pp.235-246
    • /
    • 2024
  • In high-dimensional data analysis, sufficient dimension reduction (SDR) has been considered as an attractive tool for reducing the dimensionality of predictors while preserving regression information. The principal support vector machine (PSVM) (Li et al., 2011) offers a unified approach for both linear and nonlinear SDR. This article comprehensively explores a variety of SDR methods based on the PSVM, which we call principal machines (PM) for SDR. The PM achieves SDR by solving a sequence of convex optimizations akin to popular supervised learning methods, such as the support vector machine, logistic regression, and quantile regression, to name a few. This makes the PM straightforward to handle and extend in both theoretical and computational aspects, as we will see throughout this article.

사전 클러스터링을 이용한 LDA-확장법들의 최적화 (On Optimizing LDA-extentions Using a Pre-Clustering)

  • 김상운;구범용;최우영
    • 전자공학회논문지CI
    • /
    • 제44권3호
    • /
    • pp.98-107
    • /
    • 2007
  • 얼굴인식 등과 같은 고차원 패턴인식에서 학습패턴의 수가 패턴 차원에 비해 매우 적을 경우 희소성 문제(the Small Sample Size problem)가 발생한다. 최근 이 문제를 해결하기 위하여 LDA, PCA+LDA, Direct-LDA 등을 비롯한 다양한 LDA-확장 법이 제안되었다. 본 논문에서는 LDA-확장 법으로 차원을 축소하기 전에 학습 패턴을 사전 클러스터링하여 서브 클래스 수를 증가시키는 방법으로 LDA-확장에 기반을 둔 식별기의 성능을 향상시키는 방법을 제안한다. LDA (또는 Direct-LDA)에서 축소된 특징공간의 차원은 학습패턴의 클래스 수로 제한되기 때문에 LDA의 식별 성능을 향상시킬 수 있도록 학습패턴을 사전에 클러스터링하여 서브 클래스의 수를 증가시키는 방법이다. 즉, 학습패턴의 특성공간(the eigen space)은 레인지 공간(the range space)과 널 공간(the null space)으로 구성되며, 레인지 공간의 차원은 클래스 수의 증가에 따라 증가한다. 따라서 변환 행렬을 구성할 때 클래스의 수를 늘려 널 공간을 최소화하게 되면 이 공간에 기인한 정보의 손실을 최소화 할 수 있다. 제안 방법을 X-OR 형태의 인공데이터와 AT&T와 Yale 벤취마크 얼굴영상 데이터베이스를 대상으로 실험한 결과 본 방법의 효용성을 확인하였다.

A Novel Feature Selection Method in the Categorization of Imbalanced Textual Data

  • Pouramini, Jafar;Minaei-Bidgoli, Behrouze;Esmaeili, Mahdi
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제12권8호
    • /
    • pp.3725-3748
    • /
    • 2018
  • Text data distribution is often imbalanced. Imbalanced data is one of the challenges in text classification, as it leads to the loss of performance of classifiers. Many studies have been conducted so far in this regard. The proposed solutions are divided into several general categories, include sampling-based and algorithm-based methods. In recent studies, feature selection has also been considered as one of the solutions for the imbalance problem. In this paper, a novel one-sided feature selection known as probabilistic feature selection (PFS) was presented for imbalanced text classification. The PFS is a probabilistic method that is calculated using feature distribution. Compared to the similar methods, the PFS has more parameters. In order to evaluate the performance of the proposed method, the feature selection methods including Gini, MI, FAST and DFS were implemented. To assess the proposed method, the decision tree classifications such as C4.5 and Naive Bayes were used. The results of tests on Reuters-21875 and WebKB figures per F-measure suggested that the proposed feature selection has significantly improved the performance of the classifiers.

합성곱 신경망 기반 선체 표면 압력 분포의 픽셀 수준 예측 (Pixel level prediction of dynamic pressure distribution on hull surface based on convolutional neural network)

  • 김다연;서정범;이인원
    • 한국가시화정보학회지
    • /
    • 제20권2호
    • /
    • pp.78-85
    • /
    • 2022
  • In these days, the rapid development in prediction technology using artificial intelligent is being applied in a variety of engineering fields. Especially, dimensionality reduction technologies such as autoencoder and convolutional neural network have enabled the classification and regression of high-dimensional data. In particular, pixel level prediction technology enables semantic segmentation (fine-grained classification), or physical value prediction for each pixel such as depth or surface normal estimation. In this study, the pressure distribution of the ship's surface was estimated at the pixel level based on the artificial neural network. First, a potential flow analysis was performed on the hull form data generated by transforming the baseline hull form data to construct 429 datasets for learning. Thereafter, a neural network with a U-shape structure was configured to learn the pressure value at the node position of the pretreated hull form. As a result, for the hull form included in training set, it was confirmed that the neural network can make a good prediction for pressure distribution. But in case of container ship, which is not included and have different characteristics, the network couldn't give a reasonable result.

원격탐사 자료를 이용한 하와이 해안지역 식생 분류 (Vegetation Mapping of Hawaiian Coastal Lowland Using Remotely Sensed Data)

  • 박선엽
    • 한국지역지리학회지
    • /
    • 제12권4호
    • /
    • pp.496-507
    • /
    • 2006
  • 본 연구는 고해상도 자료와 하이퍼스펙트럴 자료를 혼용하여 하와이 화산 국립공원 내 해안 지역의 식생을 분류하고자 하였다. 연구지역에 주로 나타나는 식생은 3종의 초본(broomsedge, natal redtop, and pili)과 작은 관목 등으로 대표되는 비초본으로 구분된다. 분류 기법으로는 unsupervised classification과 supervised classification을 결합한 하이브리드법을 이용하여 전체적으로 3단계 분류과정을 적용하였다. 첫째로는, IKONOS 고해상 위성자료를 이용하여, 식생 및 비식생지역을 unsupervised classification법을 통해 분류하였다. 두 번째로는, minimum noise fraction(MNF) transformation을 이용하여 AVIRIS하이퍼스펙트럴 자료로부터 주성분을 추출하여 자료를 압축하는 과정을 거쳤다. 20미터 해상도를 가진 AVIRIS 픽셀들은 대부분 용암면과 식생면으로부터 반사된 복사신호가 혼합되어 있기때문에, 용암과 식생의 지표피복 비율에 따른 선형모형을 적용하여 용암면이 갖는 반사 신호를 각 픽셀로부터 제거하였다. 최종적으로, 각 픽셀에 대하여, 식생피복 비율에 비례하는 AVIRIS 하이퍼스펙트럴 자료의 식생성분을 토대로 maximum likelihood algorithm에 따라 supervised classification법을 적용하여 초지 및 관목으로 대표되는 지표식생을 분류하였다.

  • PDF

강인한 VQ-PCA에 기반한 효율적인 화자 식별 (Efficient Speaker Identification based on Robust VQ-PCA)

  • 이기용
    • 인터넷정보학회논문지
    • /
    • 제5권3호
    • /
    • pp.57-62
    • /
    • 2004
  • 본 논문에서는, 효율적인 화자 식별을 위하여 강인한 벡터 양자화 주성분 분석을 제안하였다. 제안된 방법은 화자 식별에서 특징벡터의 학습을 위한 고차원(high dimension) 문제와 이상치(Outlier)에 대한 문제를 해결 하기위하여 제안 되었다. 먼저, 제안된 방법은 M-추정을 이용하여 강인한 벡터 양자화(Vector Quantization : VQ) 에 의한 몇 개의 분리된 영역으로 데이터 공간을 나눈다. 분리된 자 영역에서 공분산 행렬로부터 강인한 주성분 분석(Principal Component Analysis)이 얻어지게 된다. 마지막으로 각 영역에서 강인한 PCA에 의하여 줄어든 차원을 갖는 변환된 특징 벡터로부터 화자의 가우시안 혼합 모델(Gaussian Mixture Model : GMM)을 구한다. 제안된 방법은 같은 성능하에서 대각 공분산 행렬을 갖는 전형적인 GMM방법과 비교할 때 더빠른 결과를 얻었으며, 데이터의 저장공간을 줄일 수 있었을 뿐 아니라, 이상치가 존재할 경우에 더욱 강인하였다.

  • PDF

DLBCL 환자의 대사경로 정보를 이용한 생존예측 (Predicting Survival of DLBCL Patients in Pathway-Based Microarray Analysis)

  • 이광현;이선호
    • 응용통계연구
    • /
    • 제23권4호
    • /
    • pp.705-713
    • /
    • 2010
  • 마이크로어레이 실험 결과로부터 생존예측지표를 개발하는 일은 관찰 유전자수가 환자의 수보다 훨씬 많고 또 반응변수가 중도절단이 포함된 생존시간이기 때문에 어려운 작업이다. 또한 개별유전자 분석의 문제점이 대두되면서 동일한 대사기능을 수행하는 유전자들의 집합을 대상으로 분석하는 방법이 대두되고 있다. DLBCL 환자들의 마이크로어레이 유전자 발현 자료와 생존시간, 유전자들의 대사경로 정보를 바탕으로 생물학적 해석이 쉬운 생존예측지표를 찾고 그 정확성을 검정하는 pilot study를 실시하였다. 또한 유전자 걸러내기가 지표의 효율성에 미치는 영향력도 비교하여 보았다.

연속형 데이터에서 E-MDR과 D-MDR방법 비교 (A Study on the Comparison between E-MDR and D-MDR in Continuous Data)

  • 이제영;이호근
    • Communications for Statistical Applications and Methods
    • /
    • 제16권4호
    • /
    • pp.579-586
    • /
    • 2009
  • 통계모형의 상호작용 효과를 분석하기위해 비모수적인 방법인 다중인자 차원 축소(MDR)방법을 사용해 왔다. MDR 방법은 사례-대조 데이터에만 적용 할 수 있다. 본 논문에서는 Regression tree 알고리즘과 더미 변수를 활용한 회귀분석 알고리즘을 사용하여 다중 범주를 High 범주와 Low범주로 분류함으로써, MDR방법에서 연속형 데이터에 적용 할 수 없는 문제를 해결하는 방법으로 제시된 Expanded MDR방법과 Dummy MDR방법을 한우의 주요 경제형질(longissimus muscle dorsi area: LMA, carcass cold weight: CWT, average daily gain: ADG)데이터에 적용하여 한우의 경제형질에 영향을 주는 주요 SNPs 마커를 규명하고, Permutation test를 통해 그 결과를 비교한다.