Collaborative Tag-based Filtering for Recommender Systems

효과적인 추천 시스템을 위한 협업적 태그 기반의 여과 기법

  • Yeon, Cheol (Department of Computer & Information Engineering, Inha University) ;
  • Ji, Ae-Ttie (Department of Computer & Information Engineering, Inha University) ;
  • Kim, Heung-Nam (Department of Computer & Information Engineering, Inha University) ;
  • Jo, Geun-Sik (Department of Computer & Information Engineering, Inha University)
  • 연철 (인하대학교 컴퓨터.정보공학과) ;
  • 지애띠 (인하대학교 컴퓨터.정보공학과) ;
  • 김흥남 (인하대학교 컴퓨터.정보공학과) ;
  • 조근식 (인하대학교 컴퓨터.정보공학과)
  • Published : 2008.06.30

Abstract

Even in a single day, an enormous amount of content including digital videos, posts, photographs, and wikis are generated on the web. It's getting more difficult to recommend to a user what he/she prefers among these contents because of the difficulty of automatically grasping of content's meanings. CF (Collaborative Filtering) is one of useful methods to recommend proper content to a user under these situations because the filtering process is only based on historical information about whether or not a target user has preferred an item before. Collaborative Tagging is the process that allows many users to annotate content with descriptive tags. Recommendation using tags can partially improve, such as the limitations of CF, the sparsity and cold-start problem. In this research, a CF method with user-created tags is proposed. Collaborative tagging is employed to grasp and filter users' preferences for items. Empirical demonstrations using real dataset from del.icio.us show that our algorithm obtains improved performance, compared with existing works.

최근 웹 2.0의 영향으로 태깅을 지원하는 인터넷 서비스들이 많아졌다. 태깅의 원래 목적은 컨텐츠를 분류하고 재검색을 용이하게 하는 것이지만, 컨텐츠에 태깅되어 있는 태그들을 분석하여 컨텐츠의 특성을 파악할 수 있다. 본 논문에서는 내용 파악이 힘든 컨텐츠들이 증가함에 따라 이러한 컨텐츠들의 효과적인 추천을 위해, 여러 사용자들에 의해 협업적으로 태깅된 정보를 이용한 여과 기법을 제시한다. 제안하는 방법은 사용자가 태깅한 정보들을 바탕으로 사용자의 관심을 파악하는 부분과 파악된 관심에 맞는 컨텐츠를 선별하는 부분으로 나뉘어진다. 사용자의 관심을 파악하는 부분은 사용자가 태깅한 정보들을 협업적 여과를 이용하고, 컨텐츠 선별은 확률적인 방법인 나이브 베이지안 분류자를 이용한다. 이를 통해 협업적 여과 방법의 문제점인 희박성 문제(sparsity problem)와 초기 사용자 문제(cold-start user probleam) 대해 기존의 방법들과 비교하여 그 효과를 보인다.

Keywords