• 제목/요약/키워드: MapReduce model

검색결과 158건 처리시간 0.024초

스톰을 기반으로 한 실시간 SNS 데이터 분석 시스템

  • 이현경;고기철;손영성;김종배
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2015년도 춘계학술대회
    • /
    • pp.435-436
    • /
    • 2015
  • 광고 효과 분석과 극대화를 위해 기업들이 SNS를 활용하는 비중이 갈수록 높아지고 있다. 특히 광고 효과의 실질적인 효과 분석을 위해 SNS 이용자를 대상으로 한 하둡 기반의 키워드 추출 분석이 곽광을 받고 있다. 기존 하둡 기반 키워드 추출 분석은 저장된 데이터를 Map Reduce 방식으로 처리하는 것이 대부분이다. 이 때문에 정보가 실시간(Real Time)으로 전파되는 SNS의 특성을 온전히 반영하지 못 하는 한계를 가지고 있다. 본 연구에서는 이러한 기존의 하둡 기반 키워드 자동 추출 모델의 한계점을 지적하고, 이를 개선하기 위해 실시간 데이터 분석이 가능한 스톰을 활용하는 모델을 제시하고자 한다.

  • PDF

An Adaptively Speculative Execution Strategy Based on Real-Time Resource Awareness in a Multi-Job Heterogeneous Environment

  • Liu, Qi;Cai, Weidong;Liu, Qiang;Shen, Jian;Fu, Zhangjie;Liu, Xiaodong;Linge, Nigel
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제11권2호
    • /
    • pp.670-686
    • /
    • 2017
  • MapReduce (MRV1), a popular programming model, proposed by Google, has been well used to process large datasets in Hadoop, an open source cloud platform. Its new version MapReduce 2.0 (MRV2) developed along with the emerging of Yarn has achieved obvious improvement over MRV1. However, MRV2 suffers from long finishing time on certain types of jobs. Speculative Execution (SE) has been presented as an approach to the problem above by backing up those delayed jobs from low-performance machines to higher ones. In this paper, an adaptive SE strategy (ASE) is presented in Hadoop-2.6.0. Experiment results have depicted that the ASE duplicates tasks according to real-time resources usage among work nodes in a cloud. In addition, the performance of MRV2 is largely improved using the ASE strategy on job execution time and resource consumption, whether in a multi-job environment.

환경공간정보와 InVEST Carbon 모형을 활용한 탄소저장량 추정 방법에 관한 연구: 세종시를 중심으로 - 생태·자연도, 국토환경성평가지도, 도시생태현황지도를 대상으로 - (A Study on the Estimation Method of Carbon Storage Using Environmental Spatial Information and InVEST Carbon Model: Focusing on Sejong Special Self-Governing City - Using Ecological and Natural Map, Environmental Conservation Value Assessment Map, and Urban Ecological Map -)

  • 황진후;장래익;전성우
    • 한국환경복원기술학회지
    • /
    • 제25권5호
    • /
    • pp.15-27
    • /
    • 2022
  • Climate change is considered a severe global problem closely related to carbon storage. However, recent urbanization and land-use changes reduce carbon stocks in terrestrial ecosystems. Recently, the role of protected areas has been emphasized as a countermeasure to the climate change, and protected areas allow the area to continue to serve as a carbon sink due to legal restrictions. This study attempted to expand the scope of these protected areas to an evaluation-based environmental spatial information theme map. In this study, the area of each grade was compared, and the distribution of land cover for each grade was analyzed using the Ecological and Nature Map, Environmental Conservation Value Assessment Map and Urban Ecological Map of Sejong Special Self-Governing City. Based on this, the average carbon storage for each grade was derived using the InVEST Carbon model. As a result of the analysis, the high-grade area of the environmental spatial information generally showed a wide area of the natural area represented by the forest area, and accordingly, the carbon storage amount was evaluated to be high. However, there are differences in the purpose of production, evaluation items, and evaluation methods between each environmental spatial information, there are differences in area, land cover, and carbon storage. Through this study, environmental spatial information based on the evaluation map can be used for land use management in the carbon aspect, and it is expected that a management plan for each grade suitable for the characteristics of each environmental spatial information is required.

Object Classification based on Weakly Supervised E2LSH and Saliency map Weighting

  • Zhao, Yongwei;Li, Bicheng;Liu, Xin;Ke, Shengcai
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제10권1호
    • /
    • pp.364-380
    • /
    • 2016
  • The most popular approach in object classification is based on the bag of visual-words model, which has several fundamental problems that restricting the performance of this method, such as low time efficiency, the synonym and polysemy of visual words, and the lack of spatial information between visual words. In view of this, an object classification based on weakly supervised E2LSH and saliency map weighting is proposed. Firstly, E2LSH (Exact Euclidean Locality Sensitive Hashing) is employed to generate a group of weakly randomized visual dictionary by clustering SIFT features of the training dataset, and the selecting process of hash functions is effectively supervised inspired by the random forest ideas to reduce the randomcity of E2LSH. Secondly, graph-based visual saliency (GBVS) algorithm is applied to detect the saliency map of different images and weight the visual words according to the saliency prior. Finally, saliency map weighted visual language model is carried out to accomplish object classification. Experimental results datasets of Pascal 2007 and Caltech-256 indicate that the distinguishability of objects is effectively improved and our method is superior to the state-of-the-art object classification methods.

소음지도를 이용한 철도소음 예측식의 연구 (A Study on the Prediction Model of Railway Noise Using Noise Map)

  • 박찬연;박인선;오종화;이재원;박상규
    • 한국소음진동공학회:학술대회논문집
    • /
    • 한국소음진동공학회 2007년도 춘계학술대회논문집
    • /
    • pp.882-886
    • /
    • 2007
  • People living in the large cities are exposed to high level noise due to road-traffic, railway-traffic and aircraft. Nowadays, some researches are ongoing to reduce the noise by using noise map. However it has to be decided which prediction model is the most suitable in Korea. In this study, it has been focused on railway noise prediction models which are employed in a commercial software(Sound Plan) and developed by Korea Railroad Research Institute, and comparative study of the prediction models has been made.

  • PDF

An Identification of Outlying Cells in Contingency Table via Correspondence Analysis Map

  • Hong, Chong Sun;Lee, Jong Cheol
    • Communications for Statistical Applications and Methods
    • /
    • 제8권1호
    • /
    • pp.39-49
    • /
    • 2001
  • When an appropriate model is fitted to explain a certain categorical data, outlying cell detection plays very important role to reduce the lack of fit. There exist many statistical methods to identify outlying cells in contingency table. In this paper, correspondence analysis is applied to identify one or two outlying cells. When corresponding relationships between categories of the row and columns are explored, we find that outlying cells could be identified via the correspondence analysis map.

  • PDF

다음 장소 예측을 위한 맵리듀스 기반의 이동 패턴 마이닝 시스템 설계 (Design of a MapReduce-Based Mobility Pattern Mining System for Next Place Prediction)

  • 김종환;이석준;김인철
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제3권8호
    • /
    • pp.321-328
    • /
    • 2014
  • 본 논문에서는 모바일 기기 사용자들의 다음 방문 장소를 효율적으로 예측할 수 있는 맵리듀스 기반의 이동 패턴 마이닝 시스템을 소개한다. 이 시스템은 대용량의 사용자 이동 궤적 데이터 집합으로부터 은닉 마코프 모델로 표현되는 각 사용자의 이동 패턴을 학습해내고, 이 모델을 현재 이동 궤적에 적용함으로써 다음 방문 장소를 예측한다. 본 시스템은 사용자별 이동 패턴 모델을 학습하는 후단부와 실시간으로 다음 방문 장소를 예측하는 전단부 등 크게 두 부분으로 구성된다. 이 중에서 후단부는 주요 장소 추출, 이동 궤적 변환, 이동 패턴 모델 학습 등 총 3개의 맵리듀스 작업 모듈들로 구성된다. 이에 반해, 본 시스템의 전단부는 이동 경로 후보군 생성, 다음 장소 예측 등 총 2개의 작업 모듈들로 구성된다. 그리고 본 시스템을 구성하는 각 작업 모듈의 맵과 리듀스 함수들은 하둡 인프라를 효과적으로 활용하여 병렬 처리를 극대화할 수 있도록 설계하였다. 대용량의 공개 벤치마크 데이터 집합인 GeoLife를 이용하여 본 논문에서 소개한 시스템의 성능을 분석하기 위한 실험들을 수행하였고, 실험 결과를 통해 본 시스템의 높은 성능을 확인할 수 있었다.

Hadoop 기반 분산 컴퓨팅 환경에서 네트워크 I/O의 성능개선을 위한 TIPC의 적용과 분석 (Applying TIPC Protocol for Increasing Network Performance in Hadoop-based Distributed Computing Environment)

  • 유대현;정상화;김태훈
    • 한국정보과학회논문지:시스템및이론
    • /
    • 제36권5호
    • /
    • pp.351-359
    • /
    • 2009
  • 최근 인터넷 서비스 기반의 데이터는 대용량화되고 있으며 대용량 데이터를 효과적으로 처리할 수 있는 구글 플랫폼, Apache Hadoop과 같은 플랫폼 기술이 각광받고 있다. 이러한 플랫폼에서는 분산 프로그래밍을 위한 기법으로 MapReduce가 수행되며, 이 과정에서 각 태스크의 결과를 전달하기 위한 네트워크 I/O의 부하 문제가 발생한다. 본 논문에서는 구글 플랫폼, Hadoop과 같은 대규모 PC 클러스터상의 분산 컴퓨팅 환경에서 네트워킹 부하를 경감하고 성능을 향상시키는 방안으로 TIPC(Transparent Inter-Process Communication)의 적용을 제안한다. TIPC는 경량화된 연결설정 및 스택 크기, 계층적 주소체계로 인해 TCP보다 가볍고 CPU 부하가 적은 장점을 가지고 있다. 본 논문에서는 Hadoop 기반 분산 컴퓨팅 환경의 특징을 분석하여 그와 유사한 실험환경을 모델화하고 다양한 프로토콜의 비교실험을 수행하였다. 실험결과 평균 전송률에서 CUBIC-TCP, SCTP와 비교해 TIPC의 성능이 가장 우수하였으며, TIPC는 CPU 점유율 측면에서 TCP와 비교해 최대 15%의 낮은 CPU 점유율을 보였다.

Spark 기반 빅데이터 처리를 위한 K-최근접 이웃 연결 (K Nearest Neighbor Joins for Big Data Processing based on Spark)

  • 기가기;정영지
    • 한국정보통신학회논문지
    • /
    • 제21권9호
    • /
    • pp.1731-1737
    • /
    • 2017
  • K-최근접 이웃 연결(KNN 연결) 알고리즘은 기계학습에서 매우 효과적인 방법으로, 작은 데이터군에 대해서 널리 사용되어 왔다. 데이터의 수가 증가함에 따라, 단일 컴퓨터에서는 메모리와 수행시간의 제약으로 실제적인 응용프로그램에서는 실행하기에 적합하지 못하였다. 최근에는 대규모 데이터 처리를 위해서, 많은 수의 컴퓨터로 이루어진 클러스터에서 실행될 수 있는 맵리듀스 (MapReduce)로 알려진 알고리즘이 널리 사용되고 있다. 하둡은 맵리듀스 알고리즘을 구현한 프레임워크이지만 스파크라고 하는 새로운 프레임워크에 의하여 그 성능이 월등히 개선되었다. 본 논문에서는, 스파크에 기반하여 구현된 KNN 연결 알고리즘을 제안하였으며, 이는 인메모리(In-Memory) 연산 기능의 장점으로 하둡보다 빠르고 보다 효율적일 것으로 기대한다. 실험을 통하여, 수행시간에 영향을 주는 요소들에 관하여 조사하였으며, 제안한 접근 방식의 우수성과 효율성을 확인하였다.

Framework for Efficient Web Page Prediction using Deep Learning

  • Kim, Kyung-Chang
    • 한국컴퓨터정보학회논문지
    • /
    • 제25권12호
    • /
    • pp.165-172
    • /
    • 2020
  • 웹에서 접근하는 정보의 폭발적인 증가에 따라 사용자의 다음 웹 페이지 사용을 예측하는 문제의 중요성이 증가되었다. 사용자의 다음 웹 페이지 접근을 예측하는 방법 중 하나가 딥 러닝 기법이다. 웹 페이지 예측 절차는 데이터 전처리 과정을 통해 웹 로그 정보들을 분석하고 딥 러닝 기법을 이용하여 분석된 웹 로그 결과를 가지고 사용자가 접근할 다음 웹 페이지를 예측한다. 본 논문에서는 웹 페이지 예측을 위한 효율적인 웹 로그 전처리 작업과 분석을 위해 딥 러닝 기법을 사용하는 웹 페이지 예측 프레임워크를 제안한다. 대용량 웹 로그 정보의 전처리 작업 속도를 높이기 위하여 Hadoop 기반 맵/리듀스(MapReduce) 프로그래밍 모델을 사용한다. 또한 웹 로그 정보의 전처리 결과를 이용한 학습과 예측을 위한 딥 러닝 기반 웹 예측 시스템을 제안한다. 실험을 통해 논문에서 제안한 방법이 기존의 방법과 비교하여 성능 개선이 있다는 사실을 보였고 아울러 다음 페이지 예측의 정확성을 보였다.