• 제목/요약/키워드: Knowledge-Based Data Mining

검색결과 263건 처리시간 0.023초

Robustness of Learning Systems Subject to Noise:Case study in forecasting chaos

  • Kim, Steven H.;Lee, Churl-Min;Oh, Heung-Sik
    • 한국경영과학회:학술대회논문집
    • /
    • 한국경영과학회 1997년도 추계학술대회발표논문집; 홍익대학교, 서울; 1 Nov. 1997
    • /
    • pp.181-184
    • /
    • 1997
  • Practical applications of learning systems usually involve complex domains exhibiting nonlinear behavior and dilution by noise. Consequently, an intelligent system must be able to adapt to nonlinear processes as well as probabilistic phenomena. An important class of application for a knowledge based systems in prediction: forecasting the future trajectory of a process as well as the consequences of any decision made by e system. This paper examines the robustness of data mining tools under varying levels of noise while predicting nonlinear processes in the form of chaotic behavior. The evaluated models include the perceptron neural network using backpropagation (BPN), the recurrent neural network (RNN) and case based reasoning (CBR). The concepts are crystallized through a case study in predicting a Henon process in the presence of various patterns of noise.

  • PDF

멀티모달 방법론과 텍스트 마이닝 기반의 뉴스 비디오 마이닝 (A News Video Mining based on Multi-modal Approach and Text Mining)

  • 이한성;임영희;유재학;오승근;박대희
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제37권3호
    • /
    • pp.127-136
    • /
    • 2010
  • 정보 통신기술이 발전함에 따라 멀티미디어 데이터를 포함하는 디지털 기록물의 양은 기하급수적으로 증가하고 있다. 특히 뉴스 비디오는 시대상을 반영하는 풍부한 정보를 내포하고 있으므로, 이를 효과적으로 관리하고 분석하기 위한 뉴스 비디오 데이터베이스 및 뉴스 비디오 마이닝은 광범위하게 연구되어왔다. 그러나 현재까지의 뉴스 비디오 관련 연구들은 뉴스 기사에 대한 브라우징, 검색, 요약에 치중되어 있으며, 뉴스 비디오에 내재되어 있는 풍부한 잠재적 지식을 탐사하는 고수준의 의미 분석 단계에는 이르지 못하고 있다. 본 논문에서는 뉴스 비디오 클립과 스크립트를 동시에 이용하는, 멀티모달 방법론과 텍스트 마이닝 기반의 뉴스 비디오 마이닝 시스템을 제안한다. 제안된 시스템은 텍스트 마이닝의 군집분석을 통해 뉴스 기사들을 자동 분류하고, 분류 결과에 대해 기간별 군집 추이그래프, 군집성장도 분석 및 네트워크 분석을 수행함으로써, 뉴스 비디오의 기사별 주제와 관련한 다각적 분석을 수행한다. 제안된 시스템의 타당성 검증을 위하여 "2007년 제2차 남북 정상회담" 관련 뉴스 비디오를 대상으로 뉴스 비디오 분석을 수행하였다.

개념적 데이터 모델링과 정보검색 시스템 디자인 (Conceptual Data Modeling and Information Retrieval System Design)

  • 오삼균
    • 한국문헌정보학회지
    • /
    • 제33권4호
    • /
    • pp.133-156
    • /
    • 1999
  • 이 논문의 목적은 개념적인 데이터 모델링이 기존의 정보 검색(IR) 시스템을 어떤 식으로 보다 향상시킬 수 있는지를 보여주는 것이다. 개념적인 데이터베이스 디자인은 1)개체들간의 관계에 기반하여 새로운 지식을 발견해 내는 데이터 마이닝 능력과 2)기존의 개별적으로 분리된 데이터베이스를 하나의 정보검색 시스템 안으로의 결합을 위해 사용된다 (예: ISI 인용, 시소러스, 서지 데이터베이스를 하나의 정보검색 시스템 안에 결집시킴). 더 나아가서, 개념적인 모델링은 수정을 용이하게 하므로, 새로운 이용자의 요구가 가미될 때마다, 개념적인 데이터 모델링에 기반한 정보검색 시스템을 수정하는 것은 기존의 정보검색 시스템 상에서보다 훨씬 수월해질 수 있다. 보다 향상된 개체-관계(Entity-Relationship) 모델이 이 논문에서 다룬 정보검색 데이터의 개념적 스키마를 개발하는데 사용되었다.

  • PDF

다차원 스트림 데이터 환경에서 이벤트 가중치를 고려한 시간 관계 탐사 (Discovering Temporal Relation Considering the Weight of Events in Multidimensional Stream Data Environment)

  • 김재인;김대인;송명진;한대영;황부현
    • 한국콘텐츠학회논문지
    • /
    • 제10권2호
    • /
    • pp.99-110
    • /
    • 2010
  • 이벤트는 환자의 증상과 같은 시간 속성을 갖는 흐름을 의미하며 센서를 통하여 수집된 스트림 데이터는 시작과 종료 시점을 갖는 인터벌 이벤트로 요약 가능하다. 그러나 대부분의 시간 마이닝 기법은 빈발 이벤트만을 고려하며, 빈발하지 않는 이벤트는 중요하더라도 제외되는 문제가 있다. 이 논문에서는 다차원 스트림 데이터 환경에서 인터벌 이벤트에 기초하여 의미있는 시간 관계에 대한 연관 규칙 마이닝 기법을 제안한다. 제안 방법은 이벤트 가중치와 이상 이벤트가 감지된 시점의 스트림 데이터만 고려하여 이벤트의 발생 횟수에 상관없이 의미있는 시간 관계에 대한 연관 규칙을 탐사한다. 그리고 성능 평가를 통하여 제안 방법이 기존의 방법에 비하여 보다 유용한 지식을 탐사함을 보인다.

데이터 웨어하우스 환경에서의 설명기반 데이터 마이닝 (Explanation-based Data Mining in Data Warehouse)

  • 김현수;이창호
    • 한국지능정보시스템학회:학술대회논문집
    • /
    • 한국지능정보시스템학회 1999년도 춘계공동학술대회-지식경영과 지식공학
    • /
    • pp.115-123
    • /
    • 1999
  • 산업계 전반에 걸친 오랜 정보시스템 운용의 결과로 대용량의 데이터들이 축적되고 있다. 이러한 데이터로부터 유용한 지식을 추출하기 위해 여러 가지 데이터 마이닝 기법들이 연구되어왔다. 특히 데이터 웨어하우스의 등장은 이러한 데이터 마이닝에 있어 필요한 데이터 제공 환경을 제공해 주고 있다. 그러나 전문가의 적절한 판단과 해석을 거치지 않은 데이터 마이닝의 결과는 당연한 사실이거나, 사실과 다른 가짜이거나 또는 관련성 없는(trivial, spurious and irrelevant)내용만 무수히 쏟아낼 수 있다. 그러므로 데이터 마이닝의 결과가 비록 통계적 유의성을 가진다 하더라도 그 정당성과 유용성에 대한 검증과정과 방법론의 정립이 필요하다. 데이터 마이닝의 가장 어려운 점은 귀납적 오류를 없애기 위해 사람이 직접 그 결과를 해석하고 판단하며 아울러 새로운 탐색 방향을 제시해야 한다는 것이다. 본 논문에서는 데이터 마이닝 기법 중 연관규칙탐사로 얻어진 결과를 설명가능성 여부의 판단을 통해 검증하는 기법을 제안하며, 이를 통해 얻어진 검증된 지식을 토대로 일반화를 통한 새로운 가설을 생성하여 데이터 웨어하우스로부터 연관규칙을 검증하는 일련의 아텍쳐(architecture)를 제시하고다 한다. 먼저 데이터 마이닝 결과에 대한 설명의 필요성을 제시하고, 데이터 웨어하우스와 데이터 마이닝 기법들에 대한 간략한 설명과 연관규칙탐사에 대한 정의 및 방법을 보이고, 대상 영역에 대한 데이터 웨어하우스으 스키마를 보였다. 다음으로 도메인 지식(domain knowledge)과 연관규칙탐사를 통해 얻어진 결과를 표현하기위한 지식표현 방법으로 Relational Predicate Logic을 제안하였다. 연관규칙탐사로 얻어진 결과를 설명하기 위한 방법으로는 연관규칙탐사로 얻어진 연관규칙에 대해 Relational Predicate Logic으로 표현된 도메인 지식으로서 설명됨을 보이게 한다. 또한 이러한 설명(explanation)을 토대로 검증된 지식을 일반화하여 새로운 가설을 연역적으로 생성하고 이를 연관규칙탐사를 통해 검증한 후 새로운 지식을 얻는 반복적인 Explanation-based Data Mining Architecture를 제시하였다. 본 연구의 의의로는 데이터 마이닝을 통한 귀납적 지식생성에 있어 귀납적 오류의 발생을 도메인 지식을 통해 설명가능 함을 보임으로 검증하고 아울러 이러한 설명을 통해 연역적으로 새로운 가설지식을 생성시켜 이를 가설검증방식으로 검증함으로써 귀납적 접근과 연역적 접근의 통합 데이터 마이닝 접근을 제시하였다는데 있다.

  • PDF

인터넷 쇼핑몰에서 원투원 마케팅을 위한 장바구니 분석 기법의 활용 (Application of Market Basket Analysis to One-to-One Marketing on Internet Storefront)

  • 강동원;이경미
    • 한국컴퓨터산업학회논문지
    • /
    • 제2권9호
    • /
    • pp.1175-1182
    • /
    • 2001
  • 원투원 마케팅(데이터베이스 마케팅 또는 관계 마케팅)은 컴퓨터의 발전과 더불어 기업 및 고객에게 이익을 가져올 것이며, 또한 고객의 세일 및 광고에 변화를 가져올 여러 분야 중의 하나이다. 인터넷 쇼핑몰에서 지능적인 고객 서비스의 일환으로, 본 논문에서는 데이터 마이닝 기법으로 잘 알려진 장바구니 분석을 이용한 개인화 된 광고를 제공하는 기법을 제시하고자 한다. 추천 기법의 핵심적인 이론으로 통계학, 데이터 마이닝, 인공 지능, 규칙 기반 매칭 등이 있다. 개인화 된 추천을 위한 규칙 기반 관점에서, 개인화를 위한 마케팅 규칙은 일반적으로 마케팅 전문가로부터 추출되어 고객의 데이터를 갖고 추정한다. 그러나 마케팅 전문가로부터 규칙을 추출하기란 매우 어려울 뿐만 아니라, 작성된 지식 기반 규칙을 검증하고 유지하기도 어렵다. 본 논문에서는 장바구니 분석 기법을 이용하여, 크로스 세일 마케팅 규칙을 추출한 뒤, 고객이 인터넷 쇼핑몰에 방문했을 때 개인화 된 광고를 제공하는데 초점을 두기로 한다.

  • PDF

다변량 데이터의 분류 성능 향상을 위한 특질 추출 및 분류 기법을 통합한 신경망 알고리즘 (Feature Selecting and Classifying Integrated Neural Network Algorithm for Multi-variate Classification)

  • 윤현수;백준걸
    • 산업공학
    • /
    • 제24권2호
    • /
    • pp.97-104
    • /
    • 2011
  • Research for multi-variate classification has been studied through two kinds of procedures which are feature selection and classification. Feature Selection techniques have been applied to select important features and the other one has improved classification performances through classifier applications. In general, each technique has been independently studied, however consideration of the interaction between both procedures has not been widely explored which leads to a degraded performance. In this paper, through integrating these two procedures, classification performance can be improved. The proposed model takes advantage of KBANN (Knowledge-Based Artificial Neural Network) which uses prior knowledge to learn NN (Neural Network) as training information. Each NN learns characteristics of the Feature Selection and Classification techniques as training sets. The integrated NN can be learned again to modify features appropriately and enhance classification performance. This innovative technique is called ALBNN (Algorithm Learning-Based Neural Network). The experiments' results show improved performance in various classification problems.

러프집합 이론을 이용한 러프 엔트로피 기반 지식감축 (Rough Entropy-based Knowledge Reduction using Rough Set Theory)

  • 박인규
    • 디지털융복합연구
    • /
    • 제12권6호
    • /
    • pp.223-229
    • /
    • 2014
  • 대용량의 지식베이스 시스템에서 유용한 정보를 추출하여 효율적인 의사결정을 수행하기 위해서는 정제된 특징추출이 필수적이고 중요한 부분이다. 러프집합이론에 있어서 최적의 리덕트의 추출과 효율적인 객체의 분류에 대한 문제점을 극복하고 자, 본 연구에서는 조건 및 결정속성의 효율적인 특징추출을 위한 러프엔트로피 기반 퀵리덕트 알고리듬을 제안한다. 제안된 알고리듬에 의해 유용한 특징을 추출하기 위한 조건부 정보엔트로피를 정의하여 중요한 특징들을 분류하는 과정을 기술한다. 또한 본 연구의 적용사례로써 실제로 UCI의 5개의 데이터에 적용하여 특징을 추출하는 시뮬레이션을 통하여 본 연구의 모델링이 기존의 방법과 비교결과, 제안된 방법이 효율성이 있음을 보인다.

Support Vector Machine 기법을 이용한 고객의 구매의도 예측 (Forecasting of Customer's Purchasing Intention Using Support Vector Machine)

  • 김진화;남기찬;이상종
    • 경영정보학연구
    • /
    • 제10권2호
    • /
    • pp.137-158
    • /
    • 2008
  • 기업 경쟁력 강화의 중요한 이슈인 대량 개별화(mass-customization)의 실행을 위하여 통합 고객관계 관리 프로세스로서의 CRM(customer relationship management)에 대한 관심과 활용에 대한 필요성은 점점 더 높아지고 있다. 특히, 기존 고객들의 구매 정보를 기반으로 고객의 구매 패턴을 파악하고 의도를 예측하는 것은 오늘날 실질적인 판매 전략을 수립하는 마케팅 분야에서 상당히 큰 비중을 차지하고 있다. 고객의 구매의도 예측에는 대량의 데이터로부터 과거에 인지하지 못했던 의미 있고, 근거 있는 정보를 추출하는 데이터마이닝(datamining)이 주로 사용되고 있다. 기존의 구매의도 예측에 사용된 데이터마이닝 기법들은 주로 신경망(neural networks)과 로지스틱 회귀분석(logistic regression analysis)이었는데, 예측 정확성 및 모형 구축의 어려움으로 인한 다양한 문제점들이 제기되고 있는 실정이다. 따라서, 본 논문에서는 기존의 기법들이 가지고 있는 단점들을 개선하기 위하여 신경망과 로지스틱 회귀분석 외에 연관규칙(association rule), 연관성 매트릭스(association matrix), 의사결정 나무(decision tree), 베이지안 망(bayesian network), SVM(support vector machine) 기법들을 추가로 제안하였다. 본 연구의 목적은 고객의 특정 상품에 대한 구매의도 예측을 위하여 새로운 알고리즘을 제시하기보다는 기존의 다양한 데이터마이닝 기법들을 적용시켜 봄으로써, 가장 우수한 예측성과를 나타내는 기법을 발견하는 것이다. 연구에 사용된 자료는 기존의 연구에서는 적용되지 않았던 편의점의 영수증 데이터이다. 예측 목표상품은 카테고리화 된 '우유'와 '냉동식품'이며, 제안된 기법들의 신뢰성을 위하여 전체 데이터를 10개의 training과 test 셋으로 중복되지 않게 구분함과 동시에 10번의 교차 검증(cross validation)을 실시하였다. 실험 결과 SVM이 영수증 데이터를 이용한 고객의 특정 상품에 대한 구매의도 예측에서 가장 우수한 성과를 나타내는 것을 확인하였다.

비정상행위 탐지를 위한 사용자 정상행위 클러스터링 기법 (Clustering Normal User Behavior for Anomaly Intrusion Detection)

  • 오상현;이원석
    • 정보처리학회논문지C
    • /
    • 제10C권7호
    • /
    • pp.857-866
    • /
    • 2003
  • 사용자 비정상 행위를 탐지하기 위해서 기존의 연구들은 주로 통계적 기법을 이용해 왔다. 그러나 이들 연구들은 주로 사용자의 평균적인 행위를 분석하기 때문에 사용자의 비정상행위가 정확하게 탐지될 수 없다. 본 논문에서는 사용자의 정상행위를 모델링하는 새로운 클러스터링 방법을 제안한다. 클러스터링은 분석 환경에서 임의 개수의 빈발 영역을 식별할 수 있기 때문에 통계적 기법에서의 부정확한 모델링 방법을 개선할 수 있다. 빈발 공통 지식은 트랜잭션 단위로 발생되는 유사 데이터 객체들의 빈도수와 각 트랜잭션에 포함된 유사 데이터 객체들의 반복 비율로 나타낼 수 있다. 이와 더불어, 제안된 방법은 공통 지식을 축약된 프로파일로 유지하는 방법을 설명한다. 따라서 생성된 프로파일을 이용하여 온라인 트랜잭션에서의 비정상 행위를 쉽게 탐지할 수 있다.