• 제목/요약/키워드: 규칙 기반 분류

검색결과 323건 처리시간 0.025초

비연계 DB 테이블상에서의 데이터 추출을 위한 규칙 기반의 데이터 마이닝 기법 (A Rule-Based Data Mining Method among the Unrelated DataBase Table)

  • 김찬일;조대호
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국퍼지및지능시스템학회 2000년도 추계학술대회 학술발표 논문집
    • /
    • pp.220-224
    • /
    • 2000
  • 데이터 마이닝란 대량의 실제 데이터에서 묵시적이고 잠재적으로 유용한 정보를 추출하는 작업이다. 본 논문에서 서로 관계가 정의되지 않은 데이터베이스의 각 테이블간에서 필요한 정보를 추출 또는 가공하기 위해 데이터 마이닝 기법을 사용한다. 마이닝 기법인 연관 규칙은 어떤 사건이 일어나면 다른 사건이 일어나는 관련성을 의미하는 것이고, 제시된 규칙 기반의 데이터 마이닝 기법은 연관 규칙의 한 분야로서 데이터를 규칙 맞게 분류하는 기법이다. 이런 마이닝 기법을 구현하기 위해 인공지능 분야의 규칙 기반의 전문가 시스템을 사용하였고, 실 시스템인 GDS(Grating automatic Drawing System)에 적용하였다.

  • PDF

딥러닝-규칙기반 병행 모델을 이용한 특허문서의 자동 IPC 분류 방법 (Hybrid Approach Combining Deep Learning and Rule-Based Model for Automatic IPC Classification of Patent Documents)

  • 김용일;오유리;심우철;고봉수;이봉건
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2019년도 제31회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.347-350
    • /
    • 2019
  • 인공지능 관련 기술의 발달로 다양한 분야에서 인공지능 활용에 대한 관심이 고조되고 있으며 전문영역에서도 기계학습 기법을 활용한 연구들이 활발하게 이루어지고 있다. 특허청에서는 분야별 전문지식을 가진 분류담당자가 출원되는 모든 특허에 국제특허분류코드(이하 IPC) 부여 작업을 수행하고 있다. IPC 분류와 같은 전문적인 업무영역에서 딥러닝을 활용한 자동 IPC 분류 서비스를 제공하기 위해서는 기계학습을 이용하는 분류 모델에 분야별 전문지식을 직관적으로 반영하는 것이 필요하다. 이를 위해 본 연구에서는 딥러닝 기반의 IPC 분류 모델과 전문지식이 반영된 분류별 어휘사전을 활용한 규칙기반 분류 모델을 병행하여 특허문서의 IPC분류를 자동으로 추천하는 방법을 제안한다.

  • PDF

산술 연산자 기반 유전자 프로그래밍을 이용한 암 분류 규칙 발견 (Rule Discovery for Cancer Classification using Genetic Programming based on Arithmetic Operators)

  • 홍진혁;조성배
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제31권8호
    • /
    • pp.999-1009
    • /
    • 2004
  • 최근 생물정보 기술이 암 진단의 새로운 방법으로 관심을 모으고 있다. 다양한 기계학습 기법이 적용되어 우수한 결과를 얻고 있지만 의학 분야에서는 정확률이 높은 분류기뿐만 아니라 획득된 분류규칙을 사람이 분석하고 이해할 수 있어야 한다. 생물정보 기술에서 많이 이용되는 유전자 발현 데이터는 데이타 내에 수천 내지 수만의 변수가 존재하며, 직접 이들 사이의 복잡한 관계를 표현하고 이해하는 것은 매우 어렵다. 본 논문에서는 이러한 어려움을 극복하기 위해 유전자 발현 데이타에서 분류에 유용한 특징들을 추출하고 산술 연산자 기반 유전자 프로그래밍으로 암 분류규칙을 생성하는 방법을 제안한다. 림프종 유전자 발현 데이타에 대하여 실험하여 96.6%의 인식률을 얻었으며, 획득된 분류 규칙을 분석하여 다양한 지식을 발견할 수 있었다.

재귀적 분할 평균에 기반한 점진적 규칙 추출 알고리즘 (An Incremental Rule Extraction Algorithm Based on Recursive Partition Averaging)

  • 한진철;김상귀;윤충화
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제34권1호
    • /
    • pp.11-17
    • /
    • 2007
  • 패턴 분류에 많이 사용되는 기법 중의 하나인 메모리 기반 추론 알고리즘은 단순히 메모리에 저장된 학습패턴 또는 초월평면과 테스트 패턴간의 거리를 계산하여 가장 가까운 학습패턴의 클래스로 분류하기 때문에 테스트 패턴을 분류하는 기준을 설명할 수 없다는 문제점을 가지고 있다. 이 문제를 해결하기 위하여, 메모리 기반 학습 기법인 RPA를 기반으로 학습패턴들에 내재된 규칙성을 표현하는 IF-THEN 형태의 규칙을 생성하는 점진적 학습 알고리즘을 제안하였다. 하지만, RPA에 의해 생성된 규칙은 주어진 학습패턴 집합에만 충실히 학습되어 overfitting 현상을 보이게 되며, 또한 패턴 공간의 과도한 분할로 인하여 필요 이상으로 많은 개수의 규칙이 생성된다. 따라서, 본 논문에서는 생성된 규칙으로부터 불필요한 조건을 제거함으로써 ovefitting 현상을 해결함과 동시에 생성되는 규칙의 개수를 줄일 수 있는 점진적 규칙 추출 알고리즘을 제안하였으며, UCI Machine Learning Repository의 벤치마크 데이터를 이용하여 제안한 알고리즘의 성능을 입증하였다.

규칙기반 단어 클러스터링에 의한 문서 분류의 성능 향상 (Performance Improvement of Document Classification by Rule-based Word Clustering)

  • 현우석
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2006년도 한국컴퓨터종합학술대회 논문집 Vol.33 No.1 (B)
    • /
    • pp.196-198
    • /
    • 2006
  • 분류되지 않은 문서의 문서 분류는 현재까지 아주 중요한 문제로 대두되고 있다. 컴퓨터를 이용한 문서 검색 엔진인 Citeseer에서는 문서 인덱싱을 하기 위해서 자동문서 분류 방법을 사용하고 있다. 문서 분류는 원본 문서의 단어들을 제1의 속성 표현으로 사용한다. 그러나 이와 같은 표현은 고차원과 속성 부족을 초래하게 된다. 단어 클러스터링은 속성 차원과 속성 부족을 감소시키기 위한 효율적인 방법이며 문서 분류 성능을 향상시켜 준다. 본 연구에서는 클러스터 속성 표현을 위한 도메인 규칙기반 단어 클러스터링 방법을 사용한다. 클러스터는 다양한 도메인 데이터베이스들과 단어 철자 속성들로부터 생성되는데, 이와 같은 클러스터 속성 표현은 중요한 차원 감소뿐만 아니라 문서 헤더 라인의 평균 분류 성능에서 향상을 보여 주었고, 원본 문서 단어 기반 속성 표현과 비교해 보았을 때 도서목록 항목 추출의 정확도를 향상시켰다.

  • PDF

퍼지 신경망과 웨이블릿 변환을 이용한 부정맥 분류 퍼지규칙의 추출 (Extracting Arrhythmia Classification Fuzzy Rules Using A Neural Network And Wavelet Transform)

  • 김덕용;임준식
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국퍼지및지능시스템학회 2005년도 추계학술대회 학술발표 논문집 제15권 제2호
    • /
    • pp.110-113
    • /
    • 2005
  • 본 논문은 가중 퍼지소속함수 기반 신경망(Neural Network with Weighted fuzzy Membership Funcstions, NEWFM)을 이용하여 심전도 신호로부터 조기심실수축(Premature Ventricular Contraction, PVC)을 판별하는 퍼지규칙을 추출하고 있다. NEWFM은 자기적응적(self adaptive) 가중 퍼지소속함수를 가지고 주어진 입력 데이터로부터 학습하여 퍼지규칙을 생성하고 이를 기반으로 정상 파형과 PVC 파형을 구분한다. 분류 성능 평가를 위하여 MIT/BIH 부정맥 데이터 베이스를 사용하였으며, NEWFM의 입력은 심전도의 파형에 웨이블릿 변환을 적용하여 추출된 웨이블릿 계수를 사용하였다. 여기에 비중복면적 분산 측정법을 적용하여 중요도가 낮은 계수를 제거하면서 최소의 m 개 특징입력만을 사용한 하이퍼박스로 단순화 시킨다. 이러한 방법으로 추출된 2개의 웨이블릿 계수를 사용한 퍼지규칙은 $96\%$의 PVC 분류성능을 보여준다.

  • PDF

림프종 암의 정확한 분류를 위한 산술연산자 분류규칙의 결합 (Ensemble of Classification Rules with Arithmetic Operators for the Accurate Classification of Lymphoma Cancer)

  • 홍진혁;조성배
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 가을 학술발표논문집 Vol.31 No.2 (1)
    • /
    • pp.202-204
    • /
    • 2004
  • 앙상블은 다수의 분류기를 효과적으로 결합하여 분류의 성능을 향상시키는 대표적인 기술이다. 효과적인 앙상블을 위해서는 다양한 특성을 지닌 분류기를 확보하여야 한다. 기존의 앙상블은 개별 분류기의 결과를 바탕으로 분류기 사이의 의존성이나 유사성을 평가하여 분류기 결합을 시도하였다. 따라서 분류기 사이의 유사도의 정확한 측정에 한계를 지니고 있다. 본 연구에서는 이를 극복하기 위해서 다수의 산술연산자 기반 분류규칙을 유전자 프로그래밍을 이용하여 획득하고, 실제 표현형의 유사성을 측정한 후 이를 바탕으로 분류기를 결합한다. 생물정보학에서 많이 사용되는 유전자 데이터 중 하나인 림포마 암 데이터에 제안하는 방법을 적용하여 97% 수준의 높은 분류 성능과 해석 가능한 분류규칙을 획득하였다.

  • PDF

퍼지 규칙기반 분류시스템에서 퍼지 분할의 선택방법 (Selection Method of Fuzzy Partitions in Fuzzy Rule-Based Classification Systems)

  • 손창식;정환묵;권순학
    • 한국지능시스템학회논문지
    • /
    • 제18권3호
    • /
    • pp.360-366
    • /
    • 2008
  • 퍼지 규칙기반 분류 시스템에서 초기의 퍼지 분할은 주어진 데이터가 가진 속성들의 도메인을 고려함으로서 결정되어지고, 최적의 분류 경계면은 초기에 정의된 퍼지 분할의 파라미터들을 조정함으로서 찾을 수 있다. 본 논문에서는 학습과정들을 사용하지 않고 패턴분류의 성능을 최대화하기 위해 통계적 정보에 기반을 둔 퍼지 분할의 선택방법을 제안한다. 제안된 방법에서 통계적 정보는 주어진 수치적인 데이터로부터 각 입력 속성의 '불확실성 영역', 즉 패턴분류문제에서 분류 경계면이 결정되는 영역을 추출하기 위해 사용되었다. 또한 통계적인 정보에 의해서 생성된 퍼지 분할구간에 대응하는 후보 규칙들을 추출하기 위한 방법과 그 후보 규칙들 간의 커플링 문제를 최소화하기 위한 방법도 추가적으로 논의하였다. 실험에서는 제안된 방법의 효용성을 보이기 위해 IRIS와 New Thyroid Cancer 데이터를 사용한 기존 패턴분류 방법들과의 분류 정확성을 비교하였고, 그 결과들로부터 제안된 방법이 기존의 방법들보다 더 좋은 분류 정확성을 제공함을 확인할 수 있었다.

캘린더 패턴 기반의 시간 연관적 분류 기법 (Temporal Associative Classification based on Calendar Patterns)

  • 이헌규;노기용;서성보;류근호
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제32권6호
    • /
    • pp.567-584
    • /
    • 2005
  • 시간 데이타마이닝은 기존 데이타마이닝에 시간 개념을 추가하여 시간 속성을 가진 데이타로부터 이전에 잘 알려지지는 않았지만 묵시적이고 잠재적으로 유용한 시간 지식을 탐사하는 기술이다. 대표적 데이타마이닝 기법인 연관규칙과 분류기법은 실세계의 여러 응용분야에서 사용된다. 그러나 대부분의 데이타가 시간 속성을 포함함에도 불구하고 기존의 기법들은 시간 속성을 고려하지 않고 주로 정적인 데이타에 대한 지식 탐사만이 진행되었다. 그리고 시간 데이타에 대한 데이타마이닝 연구들은 데이타의 발생시점과 시간 제약조건을 추가한 지식 탐사에 중점을 두고 있어 데이타가 포함한 시간 의미나 시간 관계를 탐사하는데 부족하였다. 이 논문에서는 시간 클래스 연관규칙에 기반한 시간 연관적 분류기법을 제안한다. 이 기법은 분류규칙 생성을 위해서 연관적 분류에 시간 차원을 포함하여 확장한 시간 클래스 연관규칙에 의해 탐사된 규칙들을 적용하는 것이다. 그러므로 이 기법은 기존의 분류 기법들에 비해 더 유용한 지식탐사가 가능하다.

유전 알고리즘 기반 귀납적 학습 환경에서 분류기의 통합 (Integrating Multiple Classifiers in a GA-based Inductive Learning Environment)

  • 김영준
    • 한국정보통신학회논문지
    • /
    • 제10권3호
    • /
    • pp.614-621
    • /
    • 2006
  • PROSPECTOR에서 사용한 규칙 형태의 분류 규칙을 습득하기 위한 유전 알고리즘 기반 귀납적 학습 환경에서 다중 분류기 학습법을 구현하였다. 다중 분류기 학습법은 주어진 사례 집합에 대해 다수의 분류기를 습득한 후 이를 이용하여 분류 시스템을 구축함으로써 시스템의 성능을 향상시키는 기법이다. 다중 분류기 학습법의 구현을 위해서는 분류기의 분류 결과를 취합하여 최종 결론을 도출해 내기 위한 기법이 필요하다. 본 논문에서는 각각의 클래스에 대해 분류기가 제공하는 사후 가능성을 취합하여 결론을 도출해 내는 기법과 순위에 기반을 둔 보우팅 기법을 소개하고 다중 분류기 학습법이 유전 알고리즘 기반 귀납적 학습 환경에 미치는 영향을 다수의 사례 집합을 이용하여 평가하였다.