• 제목/요약/키워드: datamining method

검색결과 37건 처리시간 0.027초

데이타마이닝 기법을 이용한 효율적인 전문 용어 클러스터링 (An Efficient Terminology Clustering Method Using Datamining Technique)

  • 이정화;남상엽;문현정;우용태
    • 한국데이타베이스학회:학술대회논문집
    • /
    • 한국데이타베이스학회 2000년도 추계학술대회 E-Business와 정보보안
    • /
    • pp.210-215
    • /
    • 2000
  • 최근 대량의 텍스트 문서로부터 의미 있는 패턴이나 연관 규칙을 발견하기 위한 텍스트마이닝 기법에 대한 연구가 활발히 전개되고 있다. 하지만 비정형 텍스트 문서로부터 추출된 용어의 수는 불규칙적이고 일반적인 용어가 많이 추출되는 관계로 일반적인 연관 규칙 탐사 방법을 사용하게 되면 무의미한 연관 규칙이 대량으로 생성되어 지식 정보를 효과적으로 검색하기 어렵다. 본 논문에서는 연관 규칙 탐사 기법을 이용하여 대량의 문서로부터 유용한 지식 정보를 찾기 위하여 의미적으로 연관된 전문 용어들끼리 클러스터링 하기 위한 방법을 제안하였다. 학술 논문을 대상으로 전문 용어를 추출하여 관련된 용어들끼리 클러스터를 구성하는 실험을 통하여 제안된 방법의 효율성을 보였다.

  • PDF

데이터마이닝을 이용한 감사데이터 학습 방법 (Audit Data Learning Method using datamining)

  • 정종근;김선종;김철원
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2005년도 추계종합학술대회
    • /
    • pp.860-862
    • /
    • 2005
  • 상용화되어 있는 대부분의 IDS는 오용 탐지 방법에 의한 것이다. 그러나 이러한 오용 탐지 방법에 의한 IDS는 침입패턴이 다양화되고 변형되기 때문에 긍정적 결함이 발생한다는 단점을 가지고 있다. 본 논문에서는 감사데이터간의 침입관계를 가지고 침입을 탐지하기 위해 데이터 마이닝 기법을 적용하여 침입 탐지 시 발생하는 긍정적 결함을 최소화 하였다. 따라서 감사데이터 학습단계에서 변형된 침입 패턴을 예측하기 위해서 데이터 마이닝 알고리즘을 적용한다.

  • PDF

데이터마이닝을 이용한 긍정적 결함 최소 학습 방법 (Learning Method for minimization false positive using datamining)

  • 정종근;하추자;김용호;박종훈;김철원;이윤배
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2003년도 봄 학술발표논문집 Vol.30 No.1 (A)
    • /
    • pp.470-472
    • /
    • 2003
  • 상용화되어 있는 대부분의 IDS는 오용 탐지 방법에 의한 것이다. 그러나 이러한 오용 탐지 방법에 의한 IDS는 침입패턴이 다양화되고 변형되기 때문에 긍정적 결함이 발생한다는 단점을 가지고 있다. 본 논문에서는 감사데이터간의 침입 관계를 가지고 침입을 탐지하기 위해 데이터 마이닝 기법을 적용하여 침입 탐지 시 발생하는 긍정적 결항을 최소화 하였다. 따라서 감사데이터 학습단계에서 변형된 침입 패턴을 예측하기 위해서 데이터 마이닝 알고리즘을 적응한다.

  • PDF

Cloning and Characterization of 6-Phosphogluconolactonase Gene in Silkworm Bombyx mori

  • Yang, HuaJun;Chen, KePing;Yao, Qin;Guo, ZhongJian
    • International Journal of Industrial Entomology and Biomaterials
    • /
    • 제14권2호
    • /
    • pp.69-74
    • /
    • 2007
  • As the genome of B. mori is available in GenBank and the EST database of B. mori is expanding, identification of novel genes of B. mori was conceivable by datamining techniques and bioinformatics tools. In this study, we used the in silico cloning method to get the 6-Phosphogluconolactonase (6PGL) gene of B. mori and analysed with bioinformatics tools. The result was confirmed by RT-PCR and prokaryotic expression. The 6PGL cDNA comtains a 702 bp ORF. The deduced protein has 233 amino acid residues, with the predicted molecular weight of 25946. 72 Da, isoelectric point of 5.41, and contains conserved NagB domains. This gene has been registered in GenBank under the accession number EF198104.

단어 연관성 가중치를 적용한 연관 문서 추천 방법 (A Method on Associated Document Recommendation with Word Correlation Weights)

  • 김선미;나인섭;신주현
    • 한국멀티미디어학회논문지
    • /
    • 제22권2호
    • /
    • pp.250-259
    • /
    • 2019
  • Big data processing technology and artificial intelligence (AI) are increasingly attracting attention. Natural language processing is an important research area of artificial intelligence. In this paper, we use Korean news articles to extract topic distributions in documents and word distribution vectors in topics through LDA-based Topic Modeling. Then, we use Word2vec to vector words, and generate a weight matrix to derive the relevance SCORE considering the semantic relationship between the words. We propose a way to recommend documents in order of high score.

데이터마이닝을 통한 방위산업기술 분석 연구: 특허분석을 중심으로 (Study for Analyzing Defense Industry Technology using Datamining technique: Patent Analysis Approach)

  • 손창호
    • 한국산학기술학회논문지
    • /
    • 제19권10호
    • /
    • pp.101-107
    • /
    • 2018
  • 최근 우리나라의 방위산업은 고도의 발전을 해왔고 국방비 중에서 국방 R&D 예산도 점차적으로 증가하고 있다. 하지만 방위산업기술에 대한 객관적인 분석 없이는 효과적인 국방 R&D 활동이 제한적이고 자칫 국방예산이 비효율적으로 사용될 수 있다. 따라서 본 논문은 현재 주로 실시하고 있는 전문가들의 의견을 반영한 정성적인 방위산업기술의 분석에 더해서 정량적인 방법으로 방위산업기술을 객관적으로 분석함으로써 국방예산의 효율적 사용과 더 나아가서는 세계시장에서의 경쟁 우위를 달성하고자 하였다. 더구나 4차 산업혁명의 키워드 중의 하나인 빅데이터 분석 방법을 국방산업기술에 적용해서 객관적이고 체계적으로 국방산업기술의 특성과 공백기술을 파악하기 위한 특허분석 방법을 제안한다. 제안된 방법은 여러 국방산업기술 중에서 화력분야의 기술에 적용하여 사례분석을 수행하였다. 그 과정은 우선 방위산업진흥원의 방위 산업기업의 분류에서 화력에 관련된 10개 국내 기업의 특허를 Kipris를 통해서 수집하고 이 중에서 IPC 코드를 활용하기 위해서 이를 전처리하여 데이터 매트릭스를 구축하였다. 그리고 R 프로그램을 활용하여 데이터마이닝 기법 중에서 각 항목 간 연관성을 파악할 수 있는 연관규칙마이닝을 수행하였다. 이를 통해서 화력분야의 각 기술에 대한 지지도, 신뢰도, 향상도 값을 도출하고 이를 해석하여 결론을 제시하였다. 따라서 본 논문은 막대한 국방예산의 효율적인 사용과 국방산업기술의 경쟁력 제고에 도움을 줄 수 있을 것이라고 판단된다.

엔트로피 분포를 이용한 규칙기반 분류분석 연구 (Rule-Based Classification Analysis Using Entropy Distribution)

  • 이정진;박해기
    • Communications for Statistical Applications and Methods
    • /
    • 제17권4호
    • /
    • pp.527-540
    • /
    • 2010
  • 규칙기반 분류분석(rule-based classification analysis)은 직관적인 이해가 쉽고 알고리즘이 복잡하지 않아 최근 대용량 데이터마이닝에 많이 이용되는 기법이다. 하지만 현재의 규칙기반 분석은 여러 개의 규칙들을 찾은후 이 규칙들을 단순히 다수결이나 또는 중요도의 가중 합으로서 새로운 데이터를 분류한다. 본 연구에서는 다항분포를 이용한 이항데이터의 분류분석 기법을 규칙 조합방법에 응용하고자한다. 다향분포의 추정을 위해서는 변형된 반복 비율 적합(iterative proportional fitting; IPF) 알고리즘을 이용하여 최대 엔트로피 분포(entropy distribution)를 찾는다. 시뮬레이션 실험 결과 이 방법은 두 집단의 데이터가 서로 유사한 경우 어느 정도 의미 있는 분류 결과를 보여주였다.

조건(암, 정상)에 따라 특이적 관계를 나타내는 유전자 쌍으로 구성된 유전자 모듈을 이용한 독립샘플의 클래스예측 (Class prediction of an independent sample using a set of gene modules consisting of gene-pairs which were condition(Tumor, Normal) specific)

  • 정현이;윤영미
    • 한국컴퓨터정보학회논문지
    • /
    • 제15권12호
    • /
    • pp.197-207
    • /
    • 2010
  • 대용량(High-throughput) 형태로 얻어진 cDNA 마이크로어레이 데이터에 다양한 데이터 마이닝 기법을 적용하면 서로 다른 조직에서 추출한 유전자의 발현정도를 비교할 수 있고 정상세포와 암세포에서 발현량의 차이를 보이는 DEG(Differently Expression Gene) 유전자를 추출할 수 있다. 이들을 이용하여 병을 진단할 수 있을 뿐만 아니라, 암의 진행 단계(Cancer Stage)에 따른 치료 방법을 결정할 수 있다. 마이크로어레이를 기반으로 한 대부분의 암 분류자는 기계학습 기법을 이용하여 암 관련 유전자를 추출하여, 이들 유전자를 총체적으로 이용하여 독립 샘플의 클래스(암, 정상)를 판정한다. 하지만 유전자의 발현량의 차이뿐만 아니라 유전자와 유전자의 상관관계의 변화가 질병 진단에 활용될 수 있다. 대부분의 질병은 단독 유전자의 변이에 의한 것이 아니라 유전자의 모듈로 이루어진 유전자조절네트워크의 변이에 의한 것이기 때문이다. 본 논문에서는 조건에 따라 특이적 관계를 나타내는 유전자 쌍을 식별하여, 이들 유전자 쌍을 이용한 유전자 분류 모듈을 생성한다. 분류 모듈을 이용한 암 분류 방법이 기존의 암 분류 방법보다 높은 정확도로 암과정상 샘플을 분류함을 보여주고 있다. 분류 모듈을 구성하는 유전자의 수가 상대적으로 적으므로 임상키트로의 개발도 고려할 수 있다. 향후 분류 모듈에 속하는 유전자의 기능적 검증을, GO(Gene Ontology)를 활용함으로서, 밝혀지지 않은 새로운 암 관련 유전자를 식별하고, 분류 모듈을 확대하여 암 특이적 유전자조절네트워크 구성에 활용할 계획이다.

분산 환경에서 신경망을 응용한 데이터 서버 마이닝 (Data Server Mining applied Neural Networks in Distributed Environment)

  • 박민기;김귀태;이재완
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2003년도 춘계종합학술대회
    • /
    • pp.473-476
    • /
    • 2003
  • 오늘날 인터넷은 하나의 거대한 분산 정보 서비스센터의 역할을 수행하며 여러 가지 많은 정보들과 이를 관리 운영하는 데이터 베이스 서버들은 분산된 네트워크 환경 속에서 광범위하게 존재하고 있다. 그러나 우리는 데이터 특성에 따라 입력 데이터를 처리할 서버를 결정하는데 여러 가지 어려움을 겪고 있다. 본 논문에서는 분산 환경 속에 존재하는 수많은 데이터들 가운데 신경망을 이용해 입력 데이터 패턴을 가장 효율적으로 처리할 수 있는 목적지 서버를 마이닝하는 기법과 이를 기반으로 한 지능적 데이터 마이닝 시스템 구조를 설계하였다. 그 결과로서 새로운 입력 데이터패턴이 신경망으로 구현된 동적 바인딩 방법에 따라 목적지 서버를 결정한 후 처리됨을 보였다. 이 기법은 데이터 웨어하우스, 통신 및 전력부하패턴 분석, 인구센서스 분석, 의료데이터 분석에 활용될 수 있다.

  • PDF

연관규칙을 이용한 개인화 시스템 설계 (Design of Personalized System using an Association Rule)

  • 윤종찬;윤성대
    • 한국정보통신학회논문지
    • /
    • 제11권6호
    • /
    • pp.1089-1098
    • /
    • 2007
  • 최근 웹상에서 사용자들의 요구가 다양해지고 있다. 또한, 웹 사용자들은 보다 편리하고 빠르게 찾고자 하는 자료나 상품을 검색하기를 원하고 있다. 이것은 웹 사용자들마다 검색 기준이나 성향이 다르기 때문에 웹 설계자가 구현한 환경을 사용하려면 불필요한 반복 작업이 따르기 때문이다. 본 논문에서는 로그파일 분석기법을 이용하여 웹 상에서 일어나는 사용자 패턴을 분석하여 웹사이트의 정보를 사용자에게 보다 효과적으로 전달하기 위한 시스템을 제안하였다. 제안한 시스템의 고객 데이터(로그파일분석)은 데이터마이닝의 툴 중의 하나인 EC-Miner를 통해 이뤄지고 각 이동경로에 가중치를 줘서 개인화에 맞도록 적절한 레이아웃을 제공하고자 한다.