• Title/Summary/Keyword: 잠재적 질의어

Search Result 9, Processing Time 0.029 seconds

Development of the Potential Query Recommendation System using User's Search History (사용자 검색이력 기반의 잠재적 질의어 추천 시스템 개발)

  • Park, Jeongbae;Park, Kinam;Lim, Heuiseok
    • Journal of Digital Convergence
    • /
    • v.11 no.7
    • /
    • pp.193-199
    • /
    • 2013
  • In this paper, a user search history based potential query recommendation system is proposed to enable the user of information search system to represent one's potential desire for information in terms of query and to facilitate the desired information to be searched. The proposed system has analyzed the association with the existing users's search histories based on the users' search query, and it has extracted the users's potential desire for information. The extracted potential desire for information is represented in terms of recommended query and thereby made recommendations to users. In order to analyze the effectiveness of the system proposed in this paper, we conducted behavioral experiments by using search histories of 27656. As a result of behavioral experiments, the experiment subjects were found to show a statistically significant higher level of satisfaction when using the proposed system as compared to using general search engines.

Query expansion by Similar words Using LSI (잠재적 의미 색인을 이용한 유사 질의어 확장)

  • Lim, Tae Hun;An, Dong Un;Chung, Seong Jong
    • Annual Conference on Human and Language Technology
    • /
    • 2009.10a
    • /
    • pp.165-169
    • /
    • 2009
  • 오늘날 인터넷 검색은 하루가 다르게 발전되고 있다. 주로 키워드 매칭에 의존을 둔 지금의 검색 서비스들은 사용자 중심의 아이템들을 개발해 정보검색의 경과시간 및 결과의 분류면에서 우수함을 보여주고 있다. 질의어의 의미에 유사한 검색은 아직은 발전하는 단계로, 내용에 기반을 둔 검색 환경에 초점이 맞춰지고 있다. 이와 관련하여 행렬의 특이치 분해(SVD)를 이용한 잠재적 의미 색인 기법(LSI)을 본 연구에서 다루고자 한다. 구축한 시스템의 성능 평가는 재현도 계산으로 비교되었는데 작은 크기의 특이값(singular value)들 생략에 의한 SVD의 성능과 그것을 재이용, 질의어에 대한 의미 구조상 근접한 용어들을 찾아 질의어를 확장한 후 적합한 문서들의 검색을 사용한 특이값 개수, 유사단어 확장 개수를 달리하여 실험하였다. 실험 결과, 특이값 2개를 사용한 잠재적 의미 색인이 특이값 3개를 사용한 잠재적 의미 색인보다 보다 나은 성능을 보였다. 그리고 조건을 달리한 모든 잠재적 의미 색인의 경우 단어 매칭에 의한 적합문서 검색보다 별 뚜렷한 나은 결과는 보이지 않았다. 하지만 의미적으로 관계가 깊은 유사어들을 찾아냈고, 의미적으로 가장 관계 깊은 문서를 대부분의 경우에서 순위 1위로 찾아내는 부분적 우수함을 보였다.

  • PDF

Finding Correlated Keyword b Analyzing User's Implicit Feedback (사용자 선호도 분석을 통한 검색어 조합 추출)

  • Chul-Woo Shim;Eun Ju Lee;Ung-Mo Kim
    • Annual Conference of KIPS
    • /
    • 2008.11a
    • /
    • pp.229-232
    • /
    • 2008
  • 웹 정보량이 급속히 늘어나면서 원하는 정보를 효율적으로 찾는 검색 기술의 중요성이 커지고 있다. 검색의 정확성을 높이기 위해서는 검색 질의어와 함께 사용자의 환경, 검색 만족도와 같은 다양한 정보가 필요하다. 사용자의 명시적 피드백을 요구하는 것은 거부감을 줄 수 있으므로 사용자의 잠재적 피드백과 연관 검색어 분석을 통해 검색 질의어를 확장하는 연구가 이뤄지고 있다. 그러나 이러한 검색어 확장과 검색 정확성 사이의 상관관계에 대한 분석이 없어 연관 검색어를 정량적으로 평가할 수 없었다. 본 논문에서는 사용자가 검색 질의어를 변경하면서 검색을 반복하는 과정을 사용자의 잠재적 피드백의 하나로 보고 사용자 만족도를 반영하는 페이지 방문 시간과 함께 분석하여 연속적으로 입력된 검색어가 검색 결과 순위와 사용자 만족도에 미치는 영향을 분석하는 방법을 제안하였다. 마우스 클릭 정보 분석을 통하여 사용자의 검색 만족도를 정량화하였고 특정 주제어에서 관련 검색어가 확장되어 가는 과정은 트리 구조로 표현하였다. 이를 통해 하나의 주제어와 관련해 연속적으로 입력된 검색어 집합으로부터 연관검색어를 추출하고 검색 결과의 정확성을 높일 수 있으며 제안된 트리 구조를 다양한 방향으로 분석하여 검색어, 검색 결과, 사용자 만족도, 배경 지식 등 단순 검색어 분석에서는 나타나지 않는 다양한 정보를 얻을 수 있다.

Extraction of Concept by Latent Semantic Indexing and k-means Clustering (잠재적 의미와 k-means 군집화를 이용한 개념추출 검색)

  • 장유진;임호섭;박기림;김민구
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2001.10b
    • /
    • pp.22-24
    • /
    • 2001
  • 정보검색 시스템에서 사용자의 질의어가 불완전함에 따라 생기는 검색 효율의 저하를 줄이기 위하여 용어의 상호관련성을 반영함과 동시에 벡터의 공간을 축소하는 LSI 모델을 사용하여 문서 집합으로부터 잠재적 의미 공간을 구축하였다. 또한 의미 공간상에 있는 문서의 분포에 따라 \"개념\"을 추출하기 하기 위해 k-means algorithm을 사용하여 군집화 시켰다. 이로부터 불완전한 초기 사용자 질의어를 의미 공간에 구축된 클러스터링 정보로 수정하여 새로운 질의어를 생성함으로 검색의 효율을 높이고자 하였다. 검색 효율을 측정하기 위해 TREC 데이터를 이용하여 분석하였으며 결과는 질의어의 성격에 따라 달라졌으나 대체적으로 우수한 성능을 보였다.한 성능을 보였다.

  • PDF

Extended Query Search Performance Evaluations for Vector Model and Probabilistic Model of Information System (정보검색시스템의 확률 및 벡터모델에 대한 질의 확장 검색 성능 평가)

  • 전유정;변동률;박순철
    • Journal of Korea Society of Industrial Information Systems
    • /
    • v.9 no.1
    • /
    • pp.36-42
    • /
    • 2004
  • In this paper, we compare the vector model performance with the probabilistic model of information system. We use LSI(Latent Semantic Indexing) model for vector model, while Condor information search system that is ready to sell on business is used as a probabilistic model. Each model produces the search results from the original queries and the queries extended by a dictionary definition. We compare those results between two models and find out the vector model is much better than the probabilistic model for the most queries.

  • PDF

Intelligne information retrieval using latent semantic analysis on the internet (인터넷에서 잠재적 의미 분석을 이용한 지능적 정보 검색)

  • 임재현;김영찬
    • The Journal of Korean Institute of Communications and Information Sciences
    • /
    • v.22 no.8
    • /
    • pp.1782-1789
    • /
    • 1997
  • Most systems that retrieve distributed information on the Internet have difficulties in retrieving relevant information for they are not able to reflect exact semantics on retrieval queries that usersrequest. In this paepr, we propose an automatic query expansion based on ter distribution which reflects semantics of retrieval term to emhance the performance of information retrieval. We computed weight, indicating its overal imoritance in the collection documents and user's query and we use LSI's SVD technique to measure the term distribution which appears similar to query. And also, we measure the similarity to compared numerical value with query terms. Also we researched the method to reduce additional terms automatically and evaluated the performance of the proposed method.

  • PDF

Data Mining Technology for Application in Humanistic Computing (인문전산학 활용을 위한 데이터마이닝기법)

  • Kwak, Ho-Hyung;Bang, Hye-Ja
    • Annual Conference of KIPS
    • /
    • 2005.05a
    • /
    • pp.593-596
    • /
    • 2005
  • 데이터마이닝은 대량의 실제 데이터로부터 이전에 잘 알려지지는 않았지만 묵시적이고 잠재적으로 유용한 정보를 추출하는 작업으로, 본 논문은 최근 인문학 정보 자료가 전산화되고 있는 가운데 대량의 정보와 특정 체계를 갖춘 ‘조선왕조실록’ 전산자료를 분석하고 기존의 단순한 정보 검색이 아닌 데이터마이닝 기법을 적용한 상세하고 예측가능 한 정보자료 추출법을 제시한다. 먼저 텍스트화 되어 있는 컨텐츠를 형태소분석기법을 사용하여 색인어를 추출하고 집계를 낸다. 질의어와 유관한 색인어의 군집정도와 출현시점을 분석하는데, 사용된 마이닝 기법은 연관규칙분석과 클러스터링 분석기법이다. 최종 결과치는 기존의 인문학연구 결과물과 비교하여 그 정확도를 분석해 보인다.

  • PDF

Temporal Data Mining Framework (시간 데이타마이닝 프레임워크)

  • Lee, Jun-Uk;Lee, Yong-Jun;Ryu, Geun-Ho
    • The KIPS Transactions:PartD
    • /
    • v.9D no.3
    • /
    • pp.365-380
    • /
    • 2002
  • Temporal data mining, the incorporation of temporal semantics to existing data mining techniques, refers to a set of techniques for discovering implicit and useful temporal knowledge from large quantities of temporal data. Temporal knowledge, expressible in the form of rules, is knowledge with temporal semantics and relationships, such as cyclic pattern, calendric pattern, trends, etc. There are many examples of temporal data, including patient histories, purchaser histories, and web log that it can discover useful temporal knowledge from. Many studies on data mining have been pursued and some of them have involved issues of temporal data mining for discovering temporal knowledge from temporal data, such as sequential pattern, similar time sequence, cyclic and temporal association rules, etc. However, all of the works treated data in database at best as data series in chronological order and did not consider temporal semantics and temporal relationships containing data. In order to solve this problem, we propose a theoretical framework for temporal data mining. This paper surveys the work to date and explores the issues involved in temporal data mining. We then define a model for temporal data mining and suggest SQL-like mining language with ability to express the task of temporal mining and show architecture of temporal mining system.

신문지 재활용 공정의 일차 점착성 이물질 실시간 정략을 위한 새로운 방법

  • 김동호;류정용;김용환;송봉근
    • Proceedings of the Korea Technical Association of the Pulp and Paper Industry Conference
    • /
    • 2002.05a
    • /
    • pp.46-48
    • /
    • 2002
  • 본 연구는 신문지 고지의 점착성 이물질 중 Primary Stickies의 정 량에 관한 것으로 서, 실제 신문지료를 화상분석하여 실시간으로 매크로크기의 점착성 이물질올 측정할 때 효율적인 측정조건을 탐색하여 제지공정의 l 현장에서 일차 점착성 이물질을 정량 하는 새로운 측정기의 측정 기준을 제시하고자 하였다. 이물질이란 제지공정에 의도적으로 첨가되지 않은 불질의 총칭으로 dirt 및 각종 점착 성 이물질 즉, stickies를 들 수 있다. 이 가운데 스틱키{stickies}란 부드럽고, 점착성을 나타내는 이물질의 총청으로 주로 점착제와 확스에 의해 형성된다. 스틱키는 고지 재활 용의 효율성을 가장 크게 저해하는 이물질로 와이어, 펠트 및 기타 공정요소에 부착되 어 초지 시 지절을 발생시킴으로써 생산성을 저하시킬 뿐 아니라, 외관상 상품가치와 인쇄적성올 저하시키며, 최종 제품의 강도적 물성 및 가공적성에도 영향을 미친다. 특 히 국내에서는 원가절감을 위해 고지의 재활용율올 증대시키고자 전력을 다하고 있으 며 환경보호 및 용수 절감올 위해 공정수를 절감하고 궁극적으로는 무방류화를 목표로 하고 있어 토지 계 내의 점착성 이물질의 투입과 농축 현상이 심각하게 진행되고 있는 실정이다. 초지공정에서 발생하는 스틱키 즉 점착성 이물질은 미세한 스크린의 슬롯 폭인 0.15 - -0.3mm 이상의 크기를 가져 스크린에 의해 분리될 수 있는 매크로 스틱키{macro s stickies}와 이보다 작은 마이크로 스틱키(micro stickies)로 크게 분류된다. 즉 매크로 스틱키는 스크린에 의해 분리될 수 있으나 마이크로 스틱키는 스크린을 통하여 기계적 으로 분리할 수 없다는 문제점을 지니고 있다. 스틱키는 또 거동 특성에 따라 primary s stickies와 secondary stickies로 구분할 수 있다. primary stickies는 펄핑과정에서 점착 성 이물질이 파괴됨에 따라 나타나지만, secondary stickies는 지류 제지공정의 백수에 용해 되거나 분산된 상태인 1때1 이하의 콜로이 드로 폰재 한다. 이 러 한 secondary stickies 는 pH, 온도의 변화나 각종의 첨가제에 의해 웅집이나 홉착 등을 발생할 수 있는 잠재 적 문제점 등을 가지고 있다. 예를 들어 양성 고분자의 첨가는 펄프 섬유를 웅집시킬 뿐 아니라 지료에 함유된 secondary dtickies의 안정성을 저하시켜 응집, 침적시키는 작용을 한다. 따라서 분리가 어렵고, 제지공정에서 문제를 일으키기 쉬운 2차 스퇴키를 적절히 제어하기 위한 기술 개발은 용수절감 뿐 아니라, 초지공정의 침적물 절감을 통 한 공정개선에도 매우 중요한 요소기술이라 할 수 있다.

  • PDF