• 제목/요약/키워드: Cleansing Algorithm

검색결과 10건 처리시간 0.034초

Automatic Electronic Cleansing in Computed Tomography Colonography Images using Domain Knowledge

  • Manjunath, KN;Siddalingaswamy, PC;Prabhu, GK
    • Asian Pacific Journal of Cancer Prevention
    • /
    • 제16권18호
    • /
    • pp.8351-8358
    • /
    • 2016
  • Electronic cleansing is an image post processing technique in which the tagged colonic content is subtracted from colon using CTC images. There are post processing artefacts, like: 1) soft tissue degradation; 2) incomplete cleansing; 3) misclassification of polyp due to pseudo enhanced voxels; and 4) pseudo soft tissue structures. The objective of the study was to subtract the tagged colonic content without losing the soft tissue structures. This paper proposes a novel adaptive method to solve the first three problems using a multi-step algorithm. It uses a new edge model-based method which involves colon segmentation, priori information of Hounsfield units (HU) of different colonic contents at specific tube voltages, subtracting the tagging materials, restoring the soft tissue structures based on selective HU, removing boundary between air-contrast, and applying a filter to clean minute particles due to improperly tagged endoluminal fluids which appear as noise. The main finding of the study was submerged soft tissue structures were absolutely preserved and the pseudo enhanced intensities were corrected without any artifact. The method was implemented with multithreading for parallel processing in a high performance computer. The technique was applied on a fecal tagged dataset (30 patients) where the tagging agent was not completely removed from colon. The results were then qualitatively validated by radiologists for any image processing artifacts.

데이터 오·결측 저감 정제 알고리즘 (Data Cleansing Algorithm for reducing Outlier)

  • 이종원;김호성;황철현;강인식;정회경
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2018년도 추계학술대회
    • /
    • pp.342-344
    • /
    • 2018
  • 본 논문에서는 기존 오 결측 데이터 분석 기법인 평균 대체법, 상관계수 수치분석, 그래프 상관성 분석 및 통계 전문가 분석 등 통계적 방법으로 대체 가능성을 조사하여 정수처리 공정에서 계측되는 각종 이상 데이터를 정제하기 위한 방법을 다양한 분석연구로 진행하였다. 또한 물 정보 데이터 오 결측 저감 정제 알고리즘의 신뢰성 및 검증에 있어 분위수 패턴과 딥러닝 기반의 LSTM 알고리즘으로 동작하는 시스템을 모델링하고, Keras, Theano, Tensorflow 등의 오픈 소스 라이브러리로 구현할 수 있는 체계를 연구하였다.

  • PDF

비즈니스 서비스간의 오류 정제를 위한 데이터 제약조건 자동 설정 기법 (An Automatic Setting Method of Data Constraints for Cleansing Data Errors between Business Services)

  • 이정원
    • 한국컴퓨터정보학회논문지
    • /
    • 제14권3호
    • /
    • pp.161-171
    • /
    • 2009
  • 본 논문에서는 SOA(Service-Oriented Architecture)를 기반으로 서비스간에 상호 작용하는 데이터의 품질 관리를 위한 오류 정제 서비스를 대상으로 데이터 제약조건 설정 시 인간 개입을 최소화하기 위한 기법을 제안한다. 단, 실세계에서 통용되는 일반적인 데이터를 모두 다루는 것은 불가능하므로 비즈니스 도메인에서 자주 사용되는 CRM(Customer Relationship Management)과 ERP(Enterprise Resource Planning) 서비스와 같이 고객 주문 정보 및 처리에 관련된 데이터를 대상으로 한다. 이를 위해, 컴포지션 되는 서비스간의 상호 작용하는 데이터를 의미적으로 확장하여 확장-엘리먼트 벡터를 생성하고 이를 기반으로 의사결정 트리(decision tree) 학습 방법을 적용하여 제약조건 설정을 자동화하기 위한 규칙 기반 시스템을 구축한다. 이 시스템을 오류정제 서비스에 삽입한 결과, 비즈니스 분야의 공개된 서비스로부터 데이터 학습을 통해 제약조건 설정을 41% 넘게 자동화 할 수 있음을 보였다.

숫자 기호화를 통한 신경기계번역 성능 향상 (Symbolizing Numbers to Improve Neural Machine Translation)

  • 강청웅;노영헌;김지수;최희열
    • 디지털콘텐츠학회 논문지
    • /
    • 제19권6호
    • /
    • pp.1161-1167
    • /
    • 2018
  • 기계 학습의 발전은 인간만이 할 수 있었던 섬세한 작업들을 기계가 할 수 있도록 이끌었고, 이에 따라 많은 기업체들은 기계 학습 기반의 번역기를 출시하였다. 현재 상용화된 번역기들은 우수한 성능을 보이지만 숫자 번역에서 문제가 발생하는 것을 발견했다. 번역기들은번역할문장에 큰숫자가 있을경우종종숫자를잘못번역하며, 같은문장에서숫자만바꿔번역할 때문장의구조를 완전히바꾸어 번역하기도 한다. 이러한 문제점은오번역의 가능성을 높이기 때문에해결해야 될 사안으로여겨진다. 본 논문에서는 Bidirectional RNN (Recurrent Neural Network), LSTM (Long Short Term Memory networks), Attention mechanism을 적용한 Neural Machine Translation 모델을 사용하여 데이터 클렌징, 사전 크기 변경을 통한 모델 최적화를 진행 하였고, 최적화된 모델에 숫자 기호화 알고리즘을 적용하여 상기 문제점을 해결하는 번역 시스템을 구현하였다. 본논문은 데이터 클렌징 방법과 사전 크기 변경, 그리고 숫자 기호화 알고리즘에 대해 서술하였으며, BLEU score (Bilingual Evaluation Understudy score) 를 이용하여 각 모델의 성능을 비교하였다.

LSTM 알고리즘을 이용한 수도데이터 정제기법 (A Study on the cleansing of water data using LSTM algorithm)

  • 유기현;김종립;신강욱
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2017년도 추계학술대회
    • /
    • pp.501-503
    • /
    • 2017
  • 수도분야에서는 정수장 및 관말 관로 상의 전 공정에서 유량, 압력, 수질, 수위 등 다양한 데이터를 수집하고 있다. 수집되는 데이터는 각 정수장 DB에 저장되며, 권역별 DB에서 합쳐져 수자원공사 본사의 DB 서버에 최종 저장된다. 측정기기가 데이터를 측정하거나 여러 과정에 걸쳐 데이터가 통신될 때 다양한 이상 데이터가 발생할 수 있으며 크게 결측 데이터와 오측 데이터로 분류할 수 있다. 각각의 이상 데이터의 발생원인은 상이하다. 따라서 오측 및 결측 데이터를 검출하는 방식에는 차이가 있으나 실제 이를 정제하는 방식은 동일하다. 본 연구에서는 딥러닝 알고리즘의 일종인 LSTM(Long Short Term Memory) 방식을 적용하여 오 결측 데이터를 자동으로 정제할 수 있는 프로그램에 대하여 고찰한다.

  • PDF

영유아 체온 데이터 기반 빅데이터 분석 및 학습을 위한 데이터 수집 시스템 구현 (Implementation of a data collection system for big data analysis and learning based on infant body temperature data)

  • 이현섭;허경용
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2021년도 춘계학술대회
    • /
    • pp.577-578
    • /
    • 2021
  • 최근 다양한 분야에서 인공지능 시스템이 활용되고 있다. 인공지능의 결정 알고리즘의 정확도는 학습량과 학습데이터의 정확도에 기인한다. 학습량의 경우 인공지능 성능에 결정적인 영향을 미치기 때문에 많은 양의 데이터가 필요하다. 학습데이터의 정확도는 여러 정제 단계를 거치면서 보정할 수 있으나 분석 이외의 자원 소모를 추가로 가져온다. 본 논문에서는 영유아의 체온 데이터를 기반으로 향후 나타날 수 있는 병증 및 유아의 상태 변화를 분석하는 시스템 구축을 위한 데이터 수집 시스템에 대하여 제안한다. 제안된 시스템은 기존 빅데이터 분석 및 학습 데이터 구축에서 서버 시스템의 자원 소모를 최소화할 수 있을 것으로 사료 된다.

  • PDF

건설 인공지능 개발사례로 보는 전공교육 인력의 중요성 (The Importance of Manpower in Major Education as an Example of Artificial Intelligence Development in Construction)

  • 허석재;이상현;이성원;김명훈;정란
    • 한국건축시공학회:학술대회논문집
    • /
    • 한국건축시공학회 2021년도 가을 학술논문 발표대회
    • /
    • pp.223-224
    • /
    • 2021
  • The process before the model learning stage in AI R&D can be subdivided into data collection/cleansing-data purification-data labeling. After that, according to the purpose of development, it goes through a stage of verifying the model by performing learning by using the algorithm of the artificial intelligence model. Several studies describe an important part of AI research as the learning stage, and try to increase the accuracy by changing the structure and layer of the AI model. However, if the refinement and labeling process of the learning data is tailored only to the model format and is not made for the purpose of development, the desired AI model cannot be obtained. The latest research reveals that most AI research failures are the failure of the learning data rather than the structure of the AI model. analyzed.

  • PDF

기능성 화장품 마케팅의 소셜 빅데이터 분석 활용 : H사 사례를 중심으로 (Application of Social Big Data Analysis for CosMedical Cosmetics Marketing : H Company Case Study)

  • 황신해;구동영;김정군
    • 디지털융복합연구
    • /
    • 제17권7호
    • /
    • pp.35-41
    • /
    • 2019
  • 본 연구는 소셜 빅데이터 분석을 통해 튼살 기능성 화장품 시장과 고객 분석을 수행하고 중소화장품제조 기업의 마케팅 활용 후 시사점을 도출하기 위해 수행되었다. 20만개 이상의 네이버 블로그, 네이버 까페, 인스타그램, 네이버스토어 게시글을 대상으로 R을 활용한 빅데이터 분석을 수행하였다. 키워드 빈도분석, 연관관계 분석을 통해 고객 니즈와 경쟁사 포지셔닝을 이해하고 마케팅 전략 수립을 위한 시사점을 도출하였다. 분석 결과 튼살 완화와 함께 예방이 핵심 소구점으로 파악되었고 선물용 시장을 위한 제품 라인의 확장이 주요 시사점으로 나타났고 제품에 대해 상호 보완할 수 있는 제품과의 연관성이 높은 것으로 나타났다. 전통적인 마케팅 기법과 함께 사용 시 소셜 빅데이터 분석은 증거기반의 의사 결정과 기존에 파악하지 못했던 고객과 시장의 특성 도출에 유용함을 확인하였다. 향후 연구에서는 word2vec과 같은 자동화된 문장 분류를 통해 추가적인 마케팅 인사이트를 얻을 수 있을 것으로 판단된다.

IT 생태계의 지속적인 운영을 위한 동적 오케스트레이션 프레임워크 (A Dynamic Orchestration Framework for Supporting Sustainable Services in IT Ecosystem)

  • 박수진
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제6권12호
    • /
    • pp.549-564
    • /
    • 2017
  • 자율성을 가지는 소프트웨어와 사물 인터넷 기술 등의 발달로 단일 시스템이 제공하는 서비스들이 다양해짐은 물론, 기존에는 상상하지 못했던 새로운 서비스들이 시스템간의 협업을 통해 제공되고 있다. 자율성을 가지는 시스템 간의 협업은 마치 생물학적 관점에서의 생태계 구성과 닮아 있다는 점에서 IT 생태계의 개념이 근래 들어 새롭게 대두되었다. IT 생태계란 단일 시스템이 아닌 다수개의 이기종 시스템들이 하나의 공통된 목적을 달성하기 위해 각자의 자율성을 활용하여 자신의 미션을 달성하는 동시에 전체 시스템 그룹의 목적을 이뤄나가는 개념이다. 우리는 앞선 연구에서 IT생태계 구현을 위한 기본적인 몇 가지 메타모델과 초보적인 수준의 아키텍처를 제안한 바 있다. 본 논문은 이러한 선행연구를 정제하여 IT생태계 시스템 구현을 위한 참조 아키텍처 프레임워크를 제안하고 있다. 제안된 프레임워크는 시스템 구성원의 동적 재구성 문제에 비용-혜택 모델을 기반으로 하는 유틸리티 함수와 IT생태계 구성원의 개체 숫자 확장에 따라 기하급수적으로 증가하는 동적 재구성 오버헤드를 감소시킬 수 있는 해결책으로서의 유전자 알고리즘 활용 방안을 포함하고 있다. 무인삼림관리를 위한 IT 생태계 시스템이라는 개연성 있는 사례 연구를 통해 제안된 프레임워크의 효용성을 정량적으로 검증하고 있다.

Hate Speech Detection Using Modified Principal Component Analysis and Enhanced Convolution Neural Network on Twitter Dataset

  • Majed, Alowaidi
    • International Journal of Computer Science & Network Security
    • /
    • 제23권1호
    • /
    • pp.112-119
    • /
    • 2023
  • Traditionally used for networking computers and communications, the Internet has been evolving from the beginning. Internet is the backbone for many things on the web including social media. The concept of social networking which started in the early 1990s has also been growing with the internet. Social Networking Sites (SNSs) sprung and stayed back to an important element of internet usage mainly due to the services or provisions they allow on the web. Twitter and Facebook have become the primary means by which most individuals keep in touch with others and carry on substantive conversations. These sites allow the posting of photos, videos and support audio and video storage on the sites which can be shared amongst users. Although an attractive option, these provisions have also culminated in issues for these sites like posting offensive material. Though not always, users of SNSs have their share in promoting hate by their words or speeches which is difficult to be curtailed after being uploaded in the media. Hence, this article outlines a process for extracting user reviews from the Twitter corpus in order to identify instances of hate speech. Through the use of MPCA (Modified Principal Component Analysis) and ECNN, we are able to identify instances of hate speech in the text (Enhanced Convolutional Neural Network). With the use of NLP, a fully autonomous system for assessing syntax and meaning can be established (NLP). There is a strong emphasis on pre-processing, feature extraction, and classification. Cleansing the text by removing extra spaces, punctuation, and stop words is what normalization is all about. In the process of extracting features, these features that have already been processed are used. During the feature extraction process, the MPCA algorithm is used. It takes a set of related features and pulls out the ones that tell us the most about the dataset we give itThe proposed categorization method is then put forth as a means of detecting instances of hate speech or abusive language. It is argued that ECNN is superior to other methods for identifying hateful content online. It can take in massive amounts of data and quickly return accurate results, especially for larger datasets. As a result, the proposed MPCA+ECNN algorithm improves not only the F-measure values, but also the accuracy, precision, and recall.