Trackback Spam Detection using Similarity Analysis by LSA

LSA 유사도 비교를 통한 트랙백 스팸 탐지

  • Jun, Hyek-Su (Department of Computer Science and Engineering, Hanyang University) ;
  • Kim, Tae-Hwan (Department of Computer Science and Engineering, Hanyang University) ;
  • Choi, Joong-Min (Department of Computer Science and Engineering, Hanyang University)
  • 전혁수 (한양대학교 컴퓨터공학과) ;
  • 김태환 (한양대학교 컴퓨터공학과) ;
  • 최중민 (한양대학교 컴퓨터공학과)
  • Published : 2010.06.30

Abstract

오늘날 인터넷 사용자들은 블로그나 뉴스 등의 매체에서 트랙백을 사용해 자신의 의견을 보다 자유롭게 나타낸다. 그러나 이러한 자유로움을 악용해 트랙백 스팸을 유발하여 네트워크의 자원을 낭비하고 방문자들에게 잘못된 정보를 전달해 해당 포스트의 신뢰를 떨어뜨린다. 트랙백 스팸은 유명한 포스트와 연계하여 자신의 포스트로 사용자들을 유도하는 특징을 가지기 때문에 일반적인 웹 스팸을 탐지하는 기술을 적용하기 어렵다. 따라서 본 논문에서는 자신이 작성한 글이 다른 사람의 글과 관련이 있다고 생각하여 다른사람의 글에 자신의 글을 링크시키는 트랙백의 특성을 이용하여 원본 페이지와 트랙백 페이지 그리고 트랙백 페이지의 아웃링크 내용상의 유사도와 동시 출현(co-occurrence) 정보를 이용하여 트랙백 스팸을 처리하고자 한다.

Keywords