• 제목/요약/키워드: 분산 데이터 분석

검색결과 1,177건 처리시간 0.027초

맵리듀스를 이용한 데이터 큐브의 상향식 계산을 위한 반복적 알고리즘 (An Iterative Algorithm for the Bottom Up Computation of the Data Cube using MapReduce)

  • 이수안;조선화;김진호
    • 정보화연구
    • /
    • 제9권4호
    • /
    • pp.455-464
    • /
    • 2012
  • 최근 데이터의 폭발적인 증가로 인해 대규모 데이터의 분석에 대한 요구를 충족할 수 있는 방법들이 계속 연구되고 있다. 본 논문에서는 맵리듀스를 이용한 분산 병렬 처리를 통해 대규모 데이터 큐브의 효율적인 계산이 가능한 MRIterativeBUC 알고리즘을 제안하였다. MRIterativeBUC 알고리즘은 기존의 BUC 알고리즘을 맵리듀스의 반복적 단계에 따른 효율적인 동작이 가능하도록 개발되었고, 기존의 대규모 데이터 큐브 계산에 따른 문제인 데이터 크기와 저장 및 처리 능력의 한계를 해결하였다. 또한, 분석자의 관심 부분에 대해서만 계산하는 빙산 큐브 개념의 도입과 파티셔닝, 정렬과 같은 큐브 계산을 분산 병렬 처리하는 방법 등의 장점들을 통해 데이터 방출량을 줄여서 네트워크 부하를 줄이고, 각 노드의 처리량을 줄이며, 궁극적으로 전체 큐브 계산 비용을 줄일 수 있다. 본 연구 결과는 맵리듀스를 이용한 데이터 큐브 계산에 대해서 상향식 처리와 반복적 알고리즘을 통해 다양한 확장이 가능하며, 여러 응용 분야에서 활용이 가능할 것으로 예상된다.

데이터베이스 시스템에서 디지털 포렌식 조사를 위한 체계적인 데이터 추출 기법 연구 (Research of organized data extraction method for digital investigation in relational database system)

  • 이동찬;이상진
    • 정보보호학회논문지
    • /
    • 제22권3호
    • /
    • pp.565-573
    • /
    • 2012
  • 기업의 탈법, 비리 등 부정행위를 조사할 경우 인사, 회계, 물류, 생산 등의 업무데이터(Business Data)의 확보가 필요하다. 다수의 기업들은 분산된 업무 데이터를 데이터베이스(Database)화하여 통합적으로 관리하고 있기 때문에 디지털 포렌식 조사를 위하여 데이터베이스에 대한 체계적인 업무데이터 추출기법 연구가 중요하다. 일반적인 정보체계 환경에서 데이터베이스는 상위 어플리케이션 및 대용량 파일 서버와 통합된 정보체계 내의 부분적 형태로 존재한다. 또한 사용자가 입력한 원시 업무 데이터는 정규화 과정을 거친 테이블 설계에 의해 하나 이상의 테이블에 분산되어 저장된다. 기존 데이터베이스 구조 분석에 관한 연구들은 데이터베이스의 최적화와 시각화를 위하여 테이블 간 연관관계 분석이 가장 중요한 연구대상이었다. 그러나 원시 업무데이터를 획득해야 하는 디지털 포렌식 관점의 연구는 테이블 간 연관관계 시각화보다 데이터의 해석이 더 중요한 연구대상이다. 본 논문에서는 데이터베이스 내부에서 미리 정의된 테이블 간 연관관계 분석기술뿐만 아니라 도메인 전문 지식(domain knowledge)을 활용한 체계화된 분석절차를 제시하여 데이터베이스에 저장된 원시 업무 데이터 구조를 분석하고 사건관련 데이터를 추출할 수 있는 분석방안을 제안한다.

SOM 기반 시공간 데이터 마이닝 시스템 (SOM-based Spatio-Temporal Data Mining System)

  • 강주영;이봉재;송재주;신진호;용환승
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2004년도 추계학술발표논문집(상)
    • /
    • pp.105-108
    • /
    • 2004
  • 데이터 양이 급증함에 따라 축적된 데이터로부터 의미있는 지식을 추출해 내고자 하는 데이터 마이닝에 대한 연구가 활발하게 진행되어 왔다. 특히 최근, 환경이 이동 분산화 되어감에 따라 감시${\cdot}$모니터링 시스템, 기상 관측 시스템, GPS 시스템과 같은 다양한 응용 시스템으로부터 방대한 양의 시공간 데이터가 발생하게 되었고, 이른 효율적으로 분석하고자 하는 시공간 데이터 마이닝 연구에 대한 관심이 더욱 높아지고 있다. 기존의 데이터 마이닝 기법의 경우 문자나 숫자 데이터를 대상으로 최적화 되어있기 때문에 시${\cdot}$공간 속성을 동시에 가지는 데이터를 분석하기에는 한계가 있는 것이 사실이다. 본 논문에서는 SOM(Self-Organizing Map)을 적용하여 시공간 클러스터링 모듈을 개발하고, 개발된 모듈의 성능 및 클러스터링 정확성을 다른 세 가지 군집분석 알고리즘과 비교, 분석하였다. 또한 가시화 모듈을 개발하여 입력 데이터의 특성과 결과를 더욱 정확하게 분석할 수 있도록 하였다.

  • PDF

GLORY-FS: 대규모 인터넷 서비스를 위한 분산 파일 시스템

  • 김홍연;진기성;차명훈;이상민;이상민;김영철;김영균
    • 정보와 통신
    • /
    • 제30권4호
    • /
    • pp.16-22
    • /
    • 2013
  • 본고에서는 분산 파일 시스템 기술의 현황 및 최근 이슈를 다룬다. 먼저 클라우드 컴퓨팅 및 빅데이터 분석 분야에서 산업체 표준으로 간주되고 있는 Hadoop의 분산 파일 시스템을 위주로 현황과 한계에 대해 다루고, 국내에서 개발된 유사한 구조의 분산 파일시스템인 GLORY-FS를 Hadoop 파일 시스템과 대비하여 국내 활용 사례를 기반으로 유사성 및 차이점을 비교한다.

SWOSpark : 분산 처리 기반 공간 웹 객체 검색 시스템 (SWOSpark : Spatial Web Object Retrieval System based on Distributed Processing)

  • 양평우;남광우
    • 정보과학회 논문지
    • /
    • 제45권1호
    • /
    • pp.53-60
    • /
    • 2018
  • 본 논문은 인 메모리 기반의 분산처리 시스템인 Spark를 이용하여 공간 웹 객체 검색 시스템을 구현한 논문이다. 소셜 네트워크의 발전은 방대한 양의 공간 웹 객체를 생성하게 되었고, 기존의 공간 웹 객체 검색 시스템을 이용한 데이터 검색이나 분석은 힘들어졌다. 최근에 분산처리 시스템의 발전은 대용량의 데이터를 빠르게 분석하고 검색하는 기능을 지원해준다. 따라서 대용량의 공간 웹 객체를 검색하기 위해서는 분산 처리 시스템을 이용한 방법이 필요하다. 분산 처리 시스템에서는 데이터가 블록 단위로 처리되고, 이러한 블록 하나를 Spark에서는 데이터를 RDD로 변환하여 처리한다. 본 논문에서는 위의 방법에 착안하여 전체 공간 영역을 기반으로 서로 겹치지 않는 공간영역으로 분할을 하고, 분할된 영역 하나당 하나의 파티션을 할당하고 각각의 파티션은 자신이 포함하고 있는 데이터에 대한 공간 웹 객체 인덱스로 구성하는 시스템을 제안한다. 즉, 본 논문에서는 공간 분할을 이용하여 분산처리 시스템을 효율적으로 이용하고, 분할된 공간에 대한 검색의 효율성을 높일 수 있는 시스템을 제안한다. 또한, 데이터의 검색을 위하여 공간 정보와 단어 정보를 같이 사용하여 인덱스를 구축하는 QP-tree를 적용한 방법과 공간 정보만을 이용하여 인덱스를 구축하는 R-tree를 적용한 방법과의 비교를 통하여 제안한 시스템이 공간 웹 객체의 검색에 더 우수한 성능을 보여주는 것을 확인할 수 있다.

아파치 스쿱을 사용한 하둡의 데이터 적재 성능 영향 요인 분석 (Analysis of the Influence Factors of Data Loading Performance Using Apache Sqoop)

  • ;고정현;여정모
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제4권2호
    • /
    • pp.77-82
    • /
    • 2015
  • 빅데이터 기술은 데이터 처리 속도가 빠르다는 면에서 주목을 받고 있다. 그리고 관계형 데이터베이스(Relational Database: RDB)에 저장되어있는 대용량 정형 데이터를 더 빠르게 처리하기 위해서 빅데이터 기술을 활용하는 연구도 진행되고 있다. 다양한 분산 처리 도구들을 사용하여 분석 성능을 측정하는 연구는 많지만 분석하기 전 단계인 정형 데이터 적재의 성능에 관한 연구는 미미하다. 때문에 본 연구에서는 RDB 안에 저장되어있는 정형 데이터를 아파치 스쿱(Apache Sqoop)을 사용하여 분산 처리 플랫폼 하둡(Hadoop)으로 적재하는 성능을 측정하였다. 그리고 적재에 영향을 미치는 요인을 분석하기 위해 여러 가지 영향 요소를 변경해가면서 반복적으로 실험을 수행하였고 RDB 기반으로 구성된 서버 간의 적재 성능과 비교하였다. 실험 환경에서 아파치 스쿱의 적재 속도가 낮았지만 실제 운영하고 있는 대규모 하둡 클러스터 환경에서는 더 많은 하드웨어 자원이 확보되기 때문에 훨씬 더 좋은 성능을 기대할 수 있다. 이는 향후 진행할 적재 성능 개선 및 하둡 환경에서 정형 데이터를 분석하는 전체적인 단계의 성능을 향상시킬 수 있는 방법에 대한 연구의 기반이 될 것으로 예상한다.

분산환경을 위한 DirecShow의 확장 방법 (Expansion Method of DirectsShwo for Distributed Environment)

  • 강명현;최성종
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송공학회 2003년도 정기총회 및 학술대회
    • /
    • pp.271-274
    • /
    • 2003
  • 본 논에서는 In-Process COM Component 기반의 DirectShow를 분산환경에서 적용하기 위해 해결해야 할 문제점을 분석하고, 해결방법을 제시한다. Microsoft사에서 제공하는 DirectShow는 Multimedia 데이터 처리용 라이브러리와 이 라이브러리를 사용하는 응용프로그램을 용이하게 제작하기 위한 Framework이다. DirectShow의 라이브러리는 COM기술을 사용하여 제작되기 때문에 재사용 및 유지보수가 용이하다. 하지만, DirectShow는 주로 멀티미디어 데이터의 재생을 위한 기술로서 멀티미디어 서버와 같이 여러 Encoder와 다중화기와 같은 기능을 구현하는데 많은 문제점이 있다. 특히, multi-Protocol Encoder와 같이 계산양이 많은 작업을 해야 할 경우 분산환경을 사용해야 한 필요가 있다. 본 논문에서는 네트워크의 분리되어 있는 두개의 필터를 연결하기 위해 필터간의 메시지 교환을 대리하는 Proxy 필터를 설계/구현하였다. 이러한 Proxy 필터를 사용하면 기존의 필터를 수정하지 않고 사용할 수 있는 장점을 갖고 있다. 특히 Binary로 배포된 필터와 연동하여 사용할 수 있다. 구현된Proxy 필터를 데이터 방송 서버에 활용함으로써 그 기능을 검증하였다.

  • PDF

소프트웨어 디자인 패턴을 적용한 실시간 분산 시뮬레이션을 위한 데이터 전달처리 시스템 설계 (Data Transmission Processing System Design for Real-Time Distributed Simulation by Using Software Design Patterns)

  • 석진원;유인태
    • 디지털콘텐츠학회 논문지
    • /
    • 제10권4호
    • /
    • pp.649-657
    • /
    • 2009
  • 일반적으로 초고속 네트워크에서 실행되는 분산 시스템의 데이터 전달처리 효율은 시스템 구조 및 데이터의 전달처리 시스템에 의존한다. 분산 환경을 이용한 실시간 분산 시뮬레이션 시스템은 데이터전달처리의 실시간성과 시스템의 신뢰성 보장을 위하여 데이터 전달처리 시스템에 의하여 요구된 성능을 만족하고자 하였다. 그러나 실시간 시뮬레이션 시스템에 적용된 클라이언트/서버 기반의 데이터 전달처리 시스템은 시스템의 안정성 및 시스템의 변경에 따른 확장성과 유지보수성 확보가 어려웠다. 따라서 기존의 데이터 전달처리 시스템의 문제점을 해결하기 위하여 새로운 데이터 전달처리 시스템이 필요하다. 본 논문에서는 기존의 실시간 시뮬레이션 시스템을 분석하여 시스템 개선방향을 제시하고, 시스템 확장성, 상호운용성, 재사용성 및 유지보수성을 위하여 소프트웨어 디자인 패턴을 적용한 새로운 실시간 데이터 전달처리 시스템을 제안한다.

  • PDF

에너지신산업을 위한 에너지 빅데이터 전처리 시스템 (Energy Big Data Pre-processing System for Energy New Industries)

  • 양수영;김요한;김상현;김원중
    • 한국전자통신학회논문지
    • /
    • 제16권5호
    • /
    • pp.851-858
    • /
    • 2021
  • 재생에너지 및 분산자원의 증가로 에너지신산업에서는 전통적인 데이터뿐만 아니라 다양한 에너지 관련 데이터들이 생성되고 있다. 즉 다양한 재생에너지 설비와 발전 데이터, 계통 운영 데이터, 계량 및 요금 관련 데이터뿐만 아니라 새로운 서비스와 분석을 위해 필요한 기상 및 에너지 효율화 데이터 등이 있다. 에너지 빅데이터 처리 기술은 분산자원, 계통, AMI(: Advanced Metering Infrastructure)를 포함한 전력 생산·소비 인프라의 전반기에서 발생하는 데이터를 체계적으로 분석 ·진단할 수 있다. 이를 통해 ICT(: Information and Communications Technology)산업과 에너지 산업 간 융복합의 새로운 비즈니스 창출을 지원하는 기술이 될 수 있을 것이다. 이를 위해서 수집된 데이터의 항목별 특성 분석 및 연관관계 표본 추출과 각 특징들의 범주화 및 요소 정의 등 데이터 분석 시스템에 대한 연구가 필요하다. 또한 데이터의 손실 및 이상 상태 처리를 위한 데이터 정제 기술에 대한 연구가 이루어져야 한다. 그리고 에너지 데이터를 실시간으로 저장 및 관리할 수 있도록 Apache NIFI, Spark, HDFS(: Hadoop Distributed File System)에 대한 개발 및 구축이 필요하다. 본 연구에서는 위와 같은 다양한 전력거래를 위한 전반적인 에너지 데이터 처리 기술과 시스템를 제안하였다.

SMILE : 마이크로어레이 데이터 저장.관리.분석을 위한 통합 LIMS 개발 (SMILE : Development of an Integrated LIMS for Management and Analysis of Microarray Data)

  • 이정원;진희정;조환규
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2006년도 가을 학술발표논문집 Vol.33 No.2 (A)
    • /
    • pp.6-10
    • /
    • 2006
  • 마이크로어레이 실험의 등장으로 한 번에 수백 개에서 수천 개의 유전자를 실험할 수 있게 되었다. 이는 기존의 실험과 비교했을 때 질적인 측면과 양적인 측면에서 가히 혁신적이라 할 수 있다. 마이크로어레이 칩을 이용한 실험에서 쏟아져 나오는 엄청난 데이터를 비교, 분석, 관리하기 위해서는 실험실의 마이크로어레이 분석 소프트웨어나 시스템간의 데이터 형식이 호환되어야 하며, 소프트웨어의 지원 또한 획기적이고 효율적이어야 한다. 본 논문에서는 다양한 종류의 마이크로어레이 입력 데이터 및 분석 데이터를 다룰 수 있고, 표준 파일 형식으로의 변환 기능을 제공하며, 마이크로어레이 이미지 분석용 소프트웨어인 ArrayMall[1,2]과 유전자 조절 네트워크 분석 시스템인 GENAW[3]를 통합하고 마이크로어레이 실험데이터의 분석, 관리 및 데이터 공유를 위한 분산 시스템인 SMILE[4]에 대해 소개한다.

  • PDF