Abstract
With services such as SNS and facebook, Big Data popularize the use of small size such as micro blogs are increasing. However, the problem of accuracy and computational cost of the search result of big data of a small size is unresolved. In this paper, we propose a subnet selection techniques based probability to improve the browsing speed of the small size of the text information from big data environments, such as micro-blogs. The proposed method is to configure the subnets to give to the attribute information of the data increased the probability data search speed. In addition, the proposed method improves the accessibility of the data by processing a pair of the connection information between the probability of the data constituting the subnet to easily access the distributed data. Experimental results showed the proposed method is 6.8% higher detection rates than CELF algorithm, the average processing time was reduced by 8.2%.
SNS와 페이스북과 같은 서비스가 대중화되면서 마이크로블로그와 같은 작은 크기의 빅 데이터 사용이 증대되고 있다. 그러나, 현재까지 작은 크기의 빅 데이터의 탐색 결과의 정확성과 계산비용은 미해결 상태로 남아있다. 본 논문에서는 빅 데이터 환경에서 마이크로블러그와 같은 작은 크기의 텍스트 정보의 탐색 속도를 향상시키기 위한 확률기반의 서브넷 선택 기법을 제안한다. 제안 기법은 데이터의 속성 정보에 확률값을 부여하여 서브넷을 구성하여 데이터 탐색 속도를 높였다. 또한, 제안 기법은 분산된 데이터를 손쉽게 접근하기 위해서 서브넷을 구성하는 데이터 의확률값 간 연계 정보를 쌍으로 처리함으로써 데이터의 접근성을 향상시켰다. 실험결과, 제안 기법은 CELF 알고리즘보다 평균 6.8% 높은 탐지율을 보였으며, 처리시간은 평균 8.2% 단축시켰다.