• 제목/요약/키워드: 단어 식별

검색결과 69건 처리시간 0.023초

서핑 참여자의 레크리에이션 전문화에 관한 횡단적 분석 (Cross-sectional analysis on recreation specialization of surfing participants)

  • 염상근;강현욱
    • 한국응용과학기술학회지
    • /
    • 제37권2호
    • /
    • pp.340-353
    • /
    • 2020
  • 본 연구는 서핑 참여자를 대상으로 입문과정에서부터 레크리에이션 전문화가 형성되는 과정을 횡단적으로 분석하여 국내에서 생소한 서핑이라는 여가활동을 소개하고 국내의 서핑참여자에 대한 이해를 제공하는데 목적이 있다. 이 연구는 참여자 각 개인이 서핑을 통해 레크리에이션 전문화에 관한 경험을 세밀하게 분석하기 위하여 문화기술지를 통해 참여자가 서핑을 즐기게 되면서 바뀌는 일상과 문화 행위패턴을 파악하면서 서핑을 통해 변화되는 삶의 의미를 도출하려고 하였다. 연구참여자는 유목적 표집법을 활용하여 11월~3월 진행되는 겨울 서핑캠프에 연구자가 참여해 10명의 연구대상자를 선정하였다. 심층 인터뷰 데이터 분석을 통해 총 531개의 개념적 단어를 식별하고 첫 번째 분류를 설정하였다. 둘째, 서핑 참가자들은 처음 서핑을 하기 전에도 서핑에 대한 기대가 높았다. 셋째, 서핑 참가자들은 여가제약을 경험하고 레크리에이션 전문화 과정에 도달하기 전 문제를 해결하기 위해 노력하였다. 넷째, 서핑 참가자들은 레크리에이션 전문화 과정을 거치는 것으로 밝혀졌다. 다섯째, 서핑 참가자들은 삶의 변화를 겪는 것으로 나타났다. 그들은 신체 훈련, 서핑 기술 향상, 자신의 비디오 분석을 통해 일상생활에서 열심히 일하면서 서핑을 더 즐기는 것으로 조사되었다.

사용자 기기에서 이용한 웹 데이터 분석을 통한 사용자 취향 분석 방법 (An Analysis Method of User Preference by using Web Usage Data in User Device)

  • 이승화;최형기;이은석
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제15권3호
    • /
    • pp.189-199
    • /
    • 2009
  • 최근 인터넷 상에 정보가 방대해지면서 사용자의 요구에 맞는 정보 필터링과 개인화 서비스가 매우 중요해지고 있다. 특히 전자상거래 분야에서 상거래를 활성화시키고 정보 제공자에 대한 만족도와 충성도를 높이기 위해, 사용자의 취향을 기반으로 한 정보 추천은 필수적인 요소가 되었다. 기존 추천 시스템은 사용자의 관심 정보를 기술한 사용자 프로파일을 대부분 정보 제공자 측에서 각각 개별적으로 수집하고 이를 기초로 추천 서비스를 제공한다. 따라서 사용자의 정보는 각 정보 제공자 측에 분산되어 존재하며, 사용자 정보가 부족한 서버에서는 초기에 추천 전략을 세우기 어렵다는 문제가 있다. 또한 사용자정보를 가지고 있는 서버의 경우에도 사용자가 해당 서버를 주기적으로 방문하지 않았다면, 사용자의 동적인 취향 변화를 반영하기 어렵다. 따라서 본 논문에서는 사용자의 행동을 통합적이고, 지속적으로 관찰할 수 있는 사용자 기기에서, 사용자가 이용한 웹 문서 분석을 통해 사용자의 관심 분야를 추론하고, 이를 다른 정보 제공자가 이용하는 새로운 구조의 추천 시스템을 제안한다. 또한 제안 시스템은 보다 효율적인 프로파일 생성을 위해, 웹 페이지에서 식별된 정보 블록에서 관심 단어를 추출하고, 앵커 태그를 분석하여 사용자의 이동 경로를 추적하는 특징을 포함하고 있다. 이러한 제안 시스템의 특징을 통해, 사용자 정보가 부족한 상점에서도 초기에 개인화 서비스 제공이 가능해지며, 사용자가 평소에 이용하는 웹 문서로부터 프로파일을 생성함으로써, 사용자의 동적인 취향 변화를 반영할 수 있다. 또한 정보 블록에서 취향 정보를 추출하는 알고리즘을 통해 보다 빠르고 정확한 프로파일 생성이 가능해진다. 본 논문에서는 최근 구매 활동이 있었던 사용자들의 웹 검색 히스토리와 구매 데이터를 이용하여 제안 시스템의 추천 정확도와 프로파일 분석에 소요되는 시간 측면의 이득을 실험하였으며, 그 결과를 통해 시스템의 유효성을 확인하였다.

CT 영상에서의 간 영역 추출 및 간 종양 분석

  • Jang Do-Won;Lim Eun-Kyung;Kim Chang-Won;Kim Min-Hwan;Kim Kwang-Baek
    • 한국지능정보시스템학회:학술대회논문집
    • /
    • 한국지능정보시스템학회 2006년도 춘계학술대회
    • /
    • pp.183-192
    • /
    • 2006
  • 간세포암은 우리나라에서 전체 암사망자 중 17.2%로 3번째의 흔한 사망원인이며, 간암에 의한 사망률은 인구 10만 명당 약 21명에 이른다. 본 논문에서는 간 내부에서 발생하는 간세포암을 CT 영상에서 자동으로 추출하는 방법을 제안하여 간세포암의 보조진단으로서의 유용성에 대해 알아보고자 한다. 간 내부의 종양을 추출하기 위해 흉부의 윗부분에서 시작하여 2.5mm의 간격으로 약 45-50장 정도를 촬영한 CT 영상들을 대상으로 먼저 간 영역을 추출한다. 간 영역 추출은 먼저 관심이 없는 외부 영역을 갈비뼈를 중심으로 제거한 후 영상의 밝기 정보를 이용하여 각 기관의 영역을 분할 한다. 분할된 영역들은 위 아래로 인접한 영상에서의 분할 영역들과 밝기 값을 비교하여 적절하게 병합하는 3차원적 접근방법을 사용한다. 간 영역은 여러개의 영역들 중에서 간 영역의 구조 및 위치 등의 정보를 활용하여 추출한다. 추출된 간 영역에서 종양 판별과 추출을 위해 종양이 가지는 특징을 분석하여 종양을 추출한다. 전형적인 간세포암은 과혈관성 종양이므로 조영증강 CT 영상에서 주위보다 밝은 색으로 나타나며, 팽창 형성장을 보일 경우에는 구형으로 나타나는 특징이 있다. 이에, 주위 보다 밝은 색을 가지고 둥근형태를 가지는 영역을 종양의 후보영역으로 선정한 후, 그 영상의 위와 아래로 연결되는 영상에서도 같은 위치에서 같은 특징을 보이는 영역이 있으면 간 내부의 종양으로 판별하여 추출한다. 제안된 간 영역 및 간 종양 추출 방법의 정확성을 판별하기 위하여 CT 영상을 대상으로 실험하여 영상의학 전문의가 판단한 결과와 비교하였다. 간 영역 추출은 정확히 모두 추출되었으며, 간 종양 추출 및 판별은 전문의의 보조 진단도구로 활용할 수 있는 가능성이 매우 높다는 것을 확인할 수 있었다.emantic Similarity Measure 등을 단계적으로 수행하여 자동화되고 정확한 규칙식별을 하고자 한다. 이러한 방법들의 조합으로 인하여 규칙구성요소 추출이 되지 않을 후보 단어들의 수를 줄여서 보다 더 정확하고, 지능적인 규칙구성요소 추출 방법론을 제시하고 구현하여 지식관리자의 규칙습득에 대한 부담을 줄여 주고자 한다. 도움을 받을 수 있게 되었다.을 거치도록 되어있다. 교통주제도는 국가의 교통정책결정과 관련분야의 기초자료로서 다양하게 활용되고 있으며, 특히 ITS 노드/링크 기본지도로 활용되는 등 교통 분야의 중요한 지리정보로서 구축되고 있다..20{\pm}0.37L$, 72시간에 $1.33{\pm}0.33L$로 유의한 차이를 보였으므로(F=6.153, P=0.004), 술 후 폐환기능 회복에 효과가 있다. 4) 실험군과 대조군의 수술 후 노력성 폐활량은 수술 후 72시간에서 실험군이 $1.90{\pm}0.61L$, 대조군이 $1.51{\pm}0.38L$로 유의한 차이를 보였다(t=2.620, P=0.013). 5) 실험군과 대조군의 수술 후 일초 노력성 호기량은 수술 후 24시간에서 $1.33{\pm}0.56L,\;1.00{\ge}0.28L$로 유의한 차이를 보였고(t=2.530, P=0.017), 술 후 72시간에서 $1.72{\pm}0.65L,\;1.33{\pm}0.3L$로 유의한 차이를 보였다(t=2.540, P=0.016). 6) 대상자의 술 후 폐환기능에 영향을 미치는 요인은 성별로 나타났다. 이에 따른 폐환기능의 차이를 보면, 실험군의 술 후 노력성 폐활량이 48시간에 남자($1.78{\pm}0.61L$)가 여자(

  • PDF

Impact of Word Embedding Methods on Performance of Sentiment Analysis with Machine Learning Techniques

  • Park, Hoyeon;Kim, Kyoung-jae
    • 한국컴퓨터정보학회논문지
    • /
    • 제25권8호
    • /
    • pp.181-188
    • /
    • 2020
  • 본 연구에서는 다양한 워드 임베딩 기법이 감성분석의 성과에 미치는 영향을 확인하기 위한 비교연구를 제안한다. 감성분석은 자연어 처리를 사용하여 텍스트 문서에서 주관적인 정보를 식별하고 추출하는 오피니언 마이닝 기법 중 하나이며, 상품평이나 댓글의 감성을 분류하는데 사용될 수 있다. 감성은 긍정적이거나 부정적인 것으로 분류될 수 있기 때문에 일반적인 분류문제 중 하나로 생각할 수 있으며, 이의 분류를 위해서는 텍스트를 컴퓨터가 인식할 수 있는 언어로 변환하여야 한다. 따라서 단어나 문서와 같은 텍스트를 자연어 처리에서 벡터로 변형하여 진행하는데 이를 워드 임베딩이라고 한다. 워드 임베딩 기법은 Bag of Words, TF-IDF, Word2Vec 등 다양한 기법이 사용되고 있는데 지금까지 감성분석에 적합한 워드 임베딩 기법에 대한 연구는 많이 진행되지 않았다. 본 연구에서는 영화 리뷰의 감성분석을 위해 다양한 워드 임베딩 기법 중 Bag of Words, TF-IDF, Word2Vec을 사용하여 그 성과를 비교 분석한다. 분석에 사용할 연구용 데이터 셋은 텍스트 마이닝에서 많이 활용되고 있는 IMDB 데이터 셋을 사용하였다. 분석 결과, TF-IDF와 Bag of Words의 성과가 Word2Vec보다 우수한 것으로 나타났으며 TF-IDF는 Bag of Words보다 성과가 우수하였으나 그 차이가 매우 크지는 않았다.

디지털 전환: D.N.A.(Data, Network, AI) 키워드를 활용한 토픽 모델링 (Digital Transformation: Using D.N.A.(Data, Network, AI) Keywords Generalized DMR Analysis)

  • 안세환;고강욱;김영민
    • 지식경영연구
    • /
    • 제23권3호
    • /
    • pp.129-152
    • /
    • 2022
  • 디지털 전환의 핵심 인프라로서 데이터·네트워크·인공지능(D.N.A.) 분야의 확산과 유망 산업의 등장은 경제 전반에 걸쳐 활발한 디지털 혁신의 기반이 되고 있다. 본 연구에서는 텍스트마이닝 방법론을 적용하여 WoS 데이터베이스의 SCIE 급 색인에 해당하는 연구의 초록, 출판연도 및 연구분야를 입력변수로 활용하여 주요 토픽을 도출하였다. 우선, 단어 출현 빈도에 기반한 TF 및 TF-IDF 분석을 통해 주요 키워드를 확인하고, 이어서 g-DMR(Generalized Dirichlet-Multinomial Regression)을 이용하여 토픽 모델링을 수행하였는데, 다양한 형태의 변수를 메타정보로 활용 가능한 해당 토픽 모형의 이점으로 단순하게 토픽을 도출하는 것 이상의 의미를 적절하게 탐색할 수 있었다. 분석 결과에 따르면, 비즈니스 인텔리전스, 제조 생산 시스템, 서비스 가치 창출, 원격 진료, 디지털 교육 등의 토픽들이 디지털 전환에서 주요 연구주제인 것으로 식별되었다. 토픽 모델링의 결과를 요약하자면, 1) COVID-19 이후 비즈니스 인텔리전스를 주제로 하는 연구가 전 영역에서 활발하게 수행되고 있으며, 2) 제조 분야에서 지능형 제조 솔루션 및 메타버스 등의 이슈가 등장함에 따라 제조 생산 시스템에 관한 주제가 다시 한번 주목받고 있음을 확인하였다. 마지막으로, 3) 주제어 자체는 기술과 서비스의 측면에서 분리하여 볼 수 있지만, 다수의 연구에서 해당 기술들을 접목하여 적용된 다양한 서비스를 포괄적으로 다루고 있으므로 이를 별개로 해석하는 것이 바람직하지 못하다는 점을 알 수 있었다.

빅데이터 마이닝에 의한 공시지가 민원의 시공간적 분석모델 제시 (A Suggestion for Spatiotemporal Analysis Model of Complaints on Officially Assessed Land Price by Big Data Mining)

  • 조태인;최병길;나영우;문영섭;김세훈
    • 지적과 국토정보
    • /
    • 제48권2호
    • /
    • pp.79-98
    • /
    • 2018
  • 이 연구는 빅데이터 마이닝에 기초하여 공시지가 민원에 대한 시공간적 특성을 분석하는 모델을 제시하는 데 목적이 있다. 특히 이 연구는 행정 민원이 제기되는 원인을 학술적 요인보다는 시공간적 측면에서 찾았고, 그러한 민원 발생의 경향을 시공간적으로 모니터링하는 모델을 제시하였다. 2006년부터 2015년까지 인천광역시 중구의 공시지가에 대한 6,481개의 민원정보가 시간 및 공간적 특성을 고려해 수집되었고 분석을 위해 사용되었다. 텍스트 마이닝 기법을 이용해 주요 키워드의 빈도수를 도출했으며, 소셜 네트워크 분석을 통해 주요 키워드 간의 관계를 분석하였다. 키워드의 가중치와 연관되는 TF(term frequency)와 TF-IDF(term frequency-inverse document frequency)를 산출함으로써, 공시지가의 민원 발생에 대한 주요 키워드를 식별하였다. 마지막으로 Getis-Ord의 $Gi^*$의 통계량에 기초한 핫스팟 분석을 통해 공시지가 민원의 시공간적 특성을 분석하였다. 연구 결과, 공시지가 민원의 특성은 시공간적으로 연계된 군집 형태를 형성하면서 변화하고 있음을 알 수 있었다. 텍스트 마이닝과 소셜 네트워크 분석 방법을 이용하여 자연어 기반의 공시지가 민원에 대한 발생 원인을 정량적으로 규명할 수 있음을 알 수 있었으며, 키워드 가중치인 단어 빈도(TF) 및 단어 빈도와 역문서 빈도의 조합값(TF-IDF)의 상대적인 차이가 있어 시공간적인 민원 특성을 분석하기 위한 주요 설명변수로 활용될 수 있음을 알 수 있었다.

사회문제 해결형 기술수요 발굴을 위한 키워드 추출 시스템 제안 (A Proposal of a Keyword Extraction System for Detecting Social Issues)

  • 정다미;김재석;김기남;허종욱;온병원;강미정
    • 지능정보연구
    • /
    • 제19권3호
    • /
    • pp.1-23
    • /
    • 2013
  • 융합 R&D가 추구해야 할 바람직한 방향은 이종 기술 간의 결합에 의한 맹목적인 신기술 창출이 아니라, 당면한 주요 문제를 해결함으로써 사회적 니즈를 충족시킬 수 있는 기술을 개발하는 것이다. 이와 같은 사회문제 해결형 기술 R&D를 촉진하기 위해서는 우선 우리 사회에서 주요 쟁점이 되고 있는 문제들을 선별해야 한다. 그런데 우선적이고 중요한 사회문제를 분별하기 위해 전문가 설문조사나 여론조사 등 기존의 사회과학 방법론을 사용하는 것은 참여자의 선입견이 개입될 수 있고 비용이 많이 소요된다는 한계를 지닌다. 기존의 사회과학 방법론이 지닌 문제점을 보완하기 위하여 본 논문에서는 사회적 이슈를 다루고 있는 대용량의 뉴스기사를 수집하고 통계적인 기법을 통하여 사회문제를 나타내는 키워드를 추출하는 시스템의 개발을 제안한다. 2009년부터 최근까지 3년 동안 10개 주요 언론사에서 생산한 약 백 30만 건의 뉴스기사에서 사회문제를 다루는 기사를 식별하고, 한글 형태소 분석, 확률기반의 토픽 모델링을 통해 사회문제 키워드를 추출한다. 또한 키워드만으로는 정확한 사회문제를 파악하기 쉽지 않기 때문에 사회문제와 연관된 키워드와 문장을 찾아서 연결하는 매칭 알고리즘을 제안하다. 마지막으로 사회문제 키워드 비주얼라이제이션 시스템을 통해 시계열에 따른 사회문제 키워드를 일목요연하게 보여줌으로써 사회문제를 쉽게 파악할 수 있도록 하였다. 특히 본 논문에서는 생성확률모델 기반의 새로운 매칭 알고리즘을 제안한다. 대용량 뉴스기사로부터 Latent Dirichlet Allocation(LDA)와 같은 토픽 모델 방법론을 사용하여 자동으로 토픽 클러스터 세트를 추출할 수 있다. 각 토픽 클러스터는 연관성 있는 단어들과 확률값으로 구성된다. 그리고 도메인 전문가는 토픽 클러스터를 분석하여, 각 토픽 클러스터의 레이블을 결정하게 된다. 이를 테면, 토픽 1 = {(실업, 0.4), (해고, 0.3), (회사, 0.3)}에서 토픽 단어들은 실업문제와 관련있으며, 도메인 전문가는 토픽 1을 실업문제로 레이블링 하게 되고, 이러한 토픽 레이블은 사회문제 키워드로 정의한다. 그러나 이와 같이 자동으로 생성된 사회문제 키워드를 분석하여 현재 우리 사회에서 어떤 문제가 발생하고 있고, 시급히 해결해야 될 문제가 무엇인지를 파악하기란 쉽지 않다. 따라서 제안된 매칭 알고리즘을 사용하여 사회문제 키워드를 요약(summarization)하는 방법론을 제시한다. 우선, 각 뉴스기사를 문단(paragraph) 단위로 세그먼트 하여 뉴스기사 대신에 문단 세트(A set of paragraphs)를 가지게 된다. 매칭 알고리즘은 각 토픽 클러스터에 대한 각 문단의 확률값을 측정하게된다. 이때 토픽 클러스터의 단어들과 확률값을 이용하여 토픽과 문단이 얼마나 연관성이 있는지를 계산하게 된다. 이러한 과정을 통해 각 토픽은 가장 연관성이 있는 문단들을 매칭할 수 있게 된다. 이러한 매칭 프로세스를 통해 사회문제 키워드와 연관된 문단들을 검토함으로써 실제 우리 사회에서 해당 사회문제 키워드와 관련해서 구체적으로 어떤 사건과 이슈가 발생하는 지를 쉽게 파악할 수 있게 된다. 또한 매칭 프로세스와 더불어 사회문제 키워드 가시화를 통해 사회문제 수요를 파악하려는 전문가들은 웹 브라우저를 통해 편리하게 특정 시간에 발생한 사회문제가 무엇이며, 구체적인 내용은 무엇인지를 파악할 수 있으며, 시간 순서에 따른 사회이슈의 변동 추이와 그 원인을 알 수 있게 된다. 개발된 시스템을 통해 최근 3년 동안 국내에서 발생했던 다양한 사회문제들을 파악하였고 개발된 알고리즘에 대한 평가를 수행하였다(본 논문에서 제안한 프로토타입 시스템은 http://dslab.snu.ac.kr/demo.html에서 이용 가능함. 단, 구글크롬, IE8.0 이상 웹 브라우저 사용 권장).

비정형 정보와 CNN 기법을 활용한 이진 분류 모델의 고객 행태 예측: 전자상거래 사례를 중심으로 (Customer Behavior Prediction of Binary Classification Model Using Unstructured Information and Convolution Neural Network: The Case of Online Storefront)

  • 김승수;김종우
    • 지능정보연구
    • /
    • 제24권2호
    • /
    • pp.221-241
    • /
    • 2018
  • 최근 딥러닝 기술이 주목을 받고 있다. 대중들의 관심을 받았던 국제 이미지 인식 기술 대회(ILSVR)와 알파고(AlphaGo)에서 사용된 딥러닝 기술이 바로 합성곱 신경망(CNN; Convolution Neural Network)이다. 합성곱 신경망은 입력 이미지를 작은 구역으로 나누어 부분적인 특징을 인식하고 이것을 결합하여 전체를 인식하는 특징을 가진다. 이러한 딥러닝 기술이 우리의 생활에 있어 많은 변화를 야기할 것이라는 기대를 주고 있지만 현재까지는 이미지 인식과 자연어 처리 등에 그 성과가 국한되어 있다. 비즈니스 문제에 대한 딥러닝 활용은 아직까지 초기 연구 단계로 향후 마케팅 응답 예측이나 허위 거래 식별, 부도 예측과 같은 전통적 비즈니스 문제들에 대해 보다 깊게 활용되고 그 성능이 입증된다면 딥러닝 기술의 활용 가치가 보다 더 주목받게 될 것으로 기대된다. 이러한 때 비교적 고객 식별이 용이하고 활용 가치가 높은 빅데이터를 보유하고 있는 전자상거래 기업의 사례를 바탕으로 하여 딥러닝 기술의 비즈니스 문제 해결 가능성을 진단해보는 것은 학술적으로 매우 의미 있는 시도라 할 수 있겠다. 이에 본 연구에서는 전자상거래 기업의 고객 행태 예측력을 높이기 위한 방안으로 합성곱 신경망을 활용한 '이종 정보 결합(Heterogeneous Information Integration)의 CNN 모델'을 제시한다. 이는 정형과 비정형 정보를 결합하여 다층 퍼셉트론 구조의 합성곱 신경망에서 학습시키는 모델로서 최적의 성능을 발휘하도록 '이종 정보 결합'과 '비정형 정보의 벡터 전환', 그리고 '다층 퍼셉트론 설계'로 하는 3개의 내부 아키텍처를 정의하고 각 아키텍처 단위로 구성되는 방식에 따른 성능을 평가하여 그 결과를 바탕으로 제안 모델을 확정하고 그 성능을 평가해보고자 한다. 고객 행태 예측을 위한 목표 변수는 전자상거래 기업에서 중요하게 관리하고 있는 재구매 고객, 이탈 고객, 고빈도 구매 고객, 고빈도 반품 고객, 고단가 구매 고객, 고할인 구매 고객 등 모두 6개의 이진 분류 문제로 정의한다. 제안한 모델의 유용성을 검증하기 위해서 국내 특정 전자상거래 기업의 실제 데이터를 활용하여 실험을 수행하였다. 실험 결과 정형과 비정형 정보를 결합하여 CNN을 활용한 제안 모델이 NBC(Naïve Bayes classification)과 SVM(Support vector machine), 그리고 ANN(Artificial neural network)에 비해서 예측 정확도와 F1 Measure가 높게 평가되었다. 또 NBC, SVM, ANN에서 정형 정보만을 사용할 때 보다 정형과 비정형 정보를 결합하여 입력 변수로 함께 활용한 경우에 예측 정확도가 향상되는 것으로 나타났다. 따라서 실험 결과로부터 비정형 정보의 활용이 고객 행태 예측의 정확도 향상에 기여한다는 점과 CNN 기법의 특징 추출 알고리즘이 VOC에 사용된 단어들의 분포와 위치 정보를 해석하여 문장의 의미를 파악하는데 효과적이라는 점을 실증적으로 확인하였다는데 그 의미가 있다고 할 수 있겠다. 이를 통해서 CNN 기법이 지금까지 소개된 이미지 인식이나 자연어 처리 분야 외에 비즈니스 문제 해결에도 활용 가치가 높다는 점을 확인하였다는데 이 연구의 의의가 있다 하겠다.

적응형 사용자 프로파일기법과 검색 결과에 대한 실시간 필터링을 이용한 개인화 정보검색 시스템 (PIRS : Personalized Information Retrieval System using Adaptive User Profiling and Real-time Filtering for Search Results)

  • 전호철;최중민
    • 지능정보연구
    • /
    • 제16권4호
    • /
    • pp.21-41
    • /
    • 2010
  • 본 논문은 다양한 사용자의 개인적 검색요구를 충족시키지 못하는 기존 검색시스템의 문제점을 해결하기 위해 사용자의 묵시적 피드백을 이용한 적응형 사용자 기호정보 기반의 개인화 검색을 실현하고, 검색결과에 대한 실시간 필터링을 통해 사용자에게 적합한 검색 결과를 제공하는 시스템을 제안한다. 기존의 검색 시스템들은 검색의도의 불확실성 때문에 사용자의 검색실패율이 높다. 검색 의도의 불확실성은 동일한 사용자가 "java"와 같은 다의어에 대해 동일한 질의어를 사용하더라도 다른 검색 결과를 원할 수 있다는 것이며, 단어의 수가 적을수록 불확실성은 가중될 것이다. 실시간 필터링은 사용자의 도메인 지정여부에 따라 주어진 도메인에 해당하는 웹문서들만 추출하거나, 적절한 도메인을 추론하고 해당하는 웹문서들만 검색 결과로 보여주는 것으로, 일반적인 디렉토리 검색과 유사하지만 모든 웹문서에 대해 이루어진다는 것과 실시간으로 분류된다는 것이 다르다. 실시간 필터링을 개인화에 활용함으로써 검색 결과의 수를 줄이고 검색만족도를 개선했다. 본 논문에서 생성한 기호정보파일은 계층적 구조로 이루어지며, 상황정보의 반영이 가능하기 때문에 의도의 불확실성을 해결 할 수 있다. 또한 사용자의 도메인별 웹문서 검색 동작을 효과적으로 추적(track) 할 수 있으며, 사용자의 기호 변화를 적절하게 알아낼 수 있다. 각 사용자 식별을 위해 IP address를 사용했으며, 기호정보파일은 사용자의 검색 행동에 대한 관찰을 기반으로 지속적으로 갱신된다. 또한 사용자의 검색결과에 대한 행동 관찰을 통해, 사용자 기호를 인지하고, 기호정보를 동적으로 반영했으며, 검색결과에 대한 만족도를 측정했다. 기호정보파일과 반영비율은 사용자가 검색을 수행할 때 시스템에 의해 생성되거나 갱신된다. 실험결과 적응형 사용자 기호정보파일과 실시간 필터링을 함께 사용함으로써, 상위 10개의 검색결과 중 평균 4.7개의 결과들에 대해 만족하는 것으로 나타났으며, 이는 구글의 결과에 비해 약 23.2% 향상된 만족도를 나타내었다.