• 제목/요약/키워드: 단일 키워드

검색결과 78건 처리시간 0.029초

한글 문서의 단어 동시 출현 정보에 개선된 TextRank를 적용한 키워드 자동 추출 기법 (Keyword Automatic Extraction Scheme with Enhanced TextRank using Word Co-Occurrence in Korean Document)

  • 송광호;민지홍;김유성
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2016년도 제28회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.62-66
    • /
    • 2016
  • 문서의 의미 기반 처리를 위해서 문서의 내용을 대표하는 키워드를 추출하는 것은 정확성과 효율성 측면에서 매우 중요한 과정이다. 그러나 단일문서로부터 키워드를 추출해 내는 기존의 연구들은 정확도가 낮거나 한정된 분야에 대해서만 검증을 수행하여 결과를 신뢰하기 어려운 문제가 있었다. 따라서 본 연구에서는 정확하면서도 다양한 분야의 텍스트에 적용 가능한 키워드 추출 방법을 제시하고자 단어의 동시출현정보와 그래프 모델을 바탕으로 TextRank 알고리즘을 변형한 새로운 형태의 알고리즘을 동시에 적용하는 키워드 추출 기법을 제안하였다. 제안한 기법을 활용하여 성능평가를 진행한 결과 기존의 연구들보다 향상된 정확도를 얻을 수 있음을 확인하였다.

  • PDF

미디어 리뷰를 이용한 영화 배경 키워드 자동 추출 기법 (Automatic Background Keyword of Movie Extraction Method from Media Reviews)

  • 김형우;조준면;유정주
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2013년도 추계학술발표대회
    • /
    • pp.1149-1151
    • /
    • 2013
  • 본 연구는 영화 콘텐츠의 배경(공간적/시간적)에 해당하는 키워드를 자동으로 추출하는 기법을 제안한다. 제안된 기법은 영화 콘텐츠들의 리뷰 텍스트 데이터를 웹 상으로부터 수집하는 과정, 수집된 텍스트 리뷰 데이터의 전처리 과정에 해당하는 형태소 분석 및 개체명인식 과정, 마지막으로 통계적 기법을 이용하여 최종적으로 배경에 해당하는 단어를 선택하는 과정으로 이루어진다. 자동으로 추출된 배경 정보는 사용자 평가를 통하여 정확도를 측정하였으며, 자동 생성된 배경 정보를 이용하여 영화 콘텐츠의 검색 및 추천 등에 다양하게 사용될 수 있을 것으로 예상된다.

OPAC에 있어서 키워드/불연산자 탐색에 대한 이용자 지식수준 연구 (Knowledge Level of Users of Keyword/Boolean Searching on an Online Public Access Catalog : SELIS)

  • 구본영
    • 한국문헌정보학회지
    • /
    • 제32권4호
    • /
    • pp.249-274
    • /
    • 1998
  • SELIS(SEoul Women's University Library and Information System) OPAC에 대한 이용자의 키워드/불연산자 탐색의 지식수준을 알아보기 위하여 4가지 사항에 따라 질문지의 결과를 분석하였다. 분석한 결과를 보면 SELIS OPAC 이용시 키워드 탐색에서 불연산자의 사용이 쉽다고 생각하고 불연산자의 사용으로 검색결과를 만족하는 이용자는 그렇지 않다고 응답한 이용자 보다 키워드/불연산 탐색의 지식수준이 높은 것으로 요약할 수 있다. 설문문항에서 제시한 지식은 키워드 탐색의 특성(단일 키워드 사용, 2개 이상의 키워드 사용), 키워드 탐색 시 불연산자의 사용, 색인에 대한 지식, 불용어 리스트에 대한 지식(비통제 용어) 키워드 탐색기법(전방일치, 우측절단). 불연산자의 올바른 사용, 키워드의 브라우징으로 주제어 선정에 관한 것이다. 앞에서 제시한 이러한 지식들은 OPAC의 키워드/불연산자 탐색에서 중요한 요소로 볼 수 있다. 성공적인 탐색을 위해서는 정보검색과정에 대한 개념적인 지식 즉, 정보요구를 탐색 가능한 질의어로 바꾸는 것과 주어진 시스템에서 질문의 결과를 얻는 방법에 대한 어의적인 지식(시스템의 특징을 어떻게 언제 이용할 것인가 하는 지식) 그리고 이용자의 질문에 대한 과학적인 기술 즉, 기본적인 컴퓨터 기술과 상세한 탐색문을 작성하는 구문론적인 지식이 요구된다. 그러나 지금까지 이용자에 대한 온라인목록 탐색의 중요한 지식으로 간주해온 것은 과학적인 기술방법에 관한 지식에만 치중하고 어의적인 지식, 개념적인 지식을 강조하는 것은 부족하였다. 따라서 온라인목록 이용에 관한 교육을 너무 과학적인 기법에만 치중할 것이 아니라 어의적 지식, 구문에 관한 기술과 개념적인 지식 교육에 초점을 맞추어야 할 것이다.

  • PDF

텍스트 마이닝을 통한 핀테크 연관 핵심 기술 특허 추출 방법 (Essential Technical Patent Extraction Method Associated with Fintech Based on Text Mining)

  • 이황로;최은미
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2015년도 추계학술발표대회
    • /
    • pp.1219-1222
    • /
    • 2015
  • 금융과 IT가 융합되는 핀테크(Fintech)가 IT산업과 금융산업에 새로운 패러다임으로 급부상하고 있다. 핀테크 기술에 대한 기술동향을 파악하고 유사한 연관 기술을 도출하는 것은 관련 사업자가 시장 경쟁에서 우위를 차지하기 위해 필요한 전략적 방향을 제시해 준다. 하지만 핀테크와 같이 단 기간 내에 기술에 대한 파급 속도가 빠르게 일어나며 산업전반에서 기술선점의 필요성이 크게 대두되는 경우 특허 데이터베이스만으로 유사기술을 검색을 위한 키워드를 선정하는 것이 어렵다는 단점이 있다. 본 논문에서는 새롭게 이슈화되는 기술 중 그 성장세가 급격하게 변화하여 등록된 특허만으로는 연관 기술 영역을 파악하는 일이 번거로운 상황에서 기사 분석을 통해 연관 기술 키워드를 추출 할 수 있는 방법을 제안하고자 한다. 특히 핀테크에서 중요하게 인식되는 결제, 보안, 사용자환경에 대한 연관 기술 키워드를 기사 내용에 포함되는 단어의 빈도 분석을 통해 추출하고자 하였다. 최종적으로 추출된 기술 키워드를 이용하여 실제 특허 검색 데이터베이스에서 관련 특허를 수집하고 분석하여 핀테크와 관련성이 매우 높은 연관 핵심 기술 특허를 도출하였다.

온톨로지 기반의 웹 문서 자동 주제 식별 (Automatic Topic Identification Based on the Ontology for Web Documents)

  • 최인대;남인길;부기동
    • 한국산업정보학회논문지
    • /
    • 제9권3호
    • /
    • pp.38-45
    • /
    • 2004
  • 본 연구의 목적은 온톨로지 계층구조에 정의된 키워드들 간의 연관성을 참조함으로써 주어진 텍스트의 주제를 식별할 수 있는 방법을 개발하는 것이다. 텍스트의 중요한 문장들로부터 추출된 키워드들은 계층구조에 존재하는 개념들에 사상된다. 모든 단어가 사상되면, 대응되는 개념들은 한 개의 단일 개념으로 일반화 되며, 그 단일 개념이 텍스트의 주제가 된다. 본 연구는 온톨로지와 단어 빈도를 사용해서 신뢰성과 정확도를 향상시키기 위한 지식 베이스와 통계적 접근을 병행한 하이브리드 방식의 접근 방식으로서 성능을 향상시켰다. 실험 결과 제안한 방법이 기존의 지식 베이스만을 사용한 방법보다 성능이 우수함을 보였다.

  • PDF

단어 관련성 추정과 바이트 페어 인코딩(Byte Pair Encoding)을 이용한 요약 기반 다중 뉴스 기사 제목 추출 (Summarization Based Multi-news Title Extraction Using Term Relevance Estimation and Byte Pair Encoding)

  • 유홍연;이승우;고영중
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2018년도 제30회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.115-119
    • /
    • 2018
  • 다중 문서 제목 추출은 하나의 주제를 가지는 다중 문서에 대한 제목을 추출하는 것을 말한다. 일반적으로 다중 문서 제목 추출에서는 다중 문서 집합을 단일 문서로 본 다음 키워드를 제목 후보군으로 추출하고, 추출된 후보를 나열하는 형식의 연구가 많이 진행되어져 왔다. 하지만 이러한 방법은 크게 두 가지의 한계점을 가지고 있다. 먼저, 다중 문서를 단순히 하나의 문서로 보는 방법은 전체적인 주제를 반영한 제목을 추출하기 어렵다는 문제점이 있다. 다음으로, 키워드를 조합하는 형식의 방법은 키워드의 단위를 찾는 방법에 따라 추출된 제목이 자연스럽지 못하다는 한계점이 있다. 따라서 본 논문에서는 이 한계점들을 보완하기 위하여 단어 관련성 추정과 Byte Pair Encoding을 이용한 요약 기반의 다중 뉴스 기사 제목 추출 방법을 제안한다. 평가를 위해서는 자동으로 군집된 총 12개의 주제에 대한 다중 뉴스 기사 집합을 사용하였으며 전문 교육을 받은 연구원들이 정성평가를 진행하여 5점 만점 기준 평균 3.68점을 얻었다.

  • PDF

문법형태소 네트워크를 이용한 자동색인 시스템의 설계 (Design of Automatic Indexing System Using Korean Morpheme Network)

  • 안성현;장재우
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1995년도 제7회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.13-17
    • /
    • 1995
  • 본 논문은 한국어 특성을 적용하여 키워드를 자동으로 추출하는 기법을 제시한다. 기존에 제안된 명사 추출 시스템인 문법형태소 네트워크를 확장하여 단일 명사 뿐만 아니라 복합 명사를 색인어로 추출한다. 복합 명사는 단일 명사에 비해 보다 한정적 개념을 가지므로, 색인어로 추출될 때 문헌의 식별력을 높일 수 있다. 복합 명사를 구성하는 각각의 단일 명사를 인식함으로써 복합 명사를 분해하고, 간단한 구단위 구문분석을 수행하는 명사 결합 규칙에 따라 단일 명사들을 복합 명사로 합성하는 방법을 제시한다. 마지막으로 이와 같이 추출된 복합 명사에, 복합 명사를 구성하는 단일 명사간의 연관성을 고려하여 보다 정확한 가중치를 부여할 수 있는 새로운 가중치 부여 방안을 제시한다.

  • PDF

사용자 의도 트리를 사용한 동적 카테고리 재구성 (Dynamic recomposition of document category using user intention tree)

  • 김효래;장영철;이창훈
    • 정보처리학회논문지B
    • /
    • 제8B권6호
    • /
    • pp.657-668
    • /
    • 2001
  • 기존에 단어의 빈도수를 근간으로 하는 문서 분류 시스템에서는 단일 키워드를 사용하기 때문에 사용자의 의도를 충분히 반영한 문서 분류가 어려웠다. 이러한 단점을 개선하기 위하여 우선 기존의 설명에 근거한 학습방법(explanation based learning)에서 한 예제만 있어도 지식베이스 정보와 함께 개념을 학습할 수 있다는 점에 착안하여 먼저 사용자 질의를 분석, 확장한 후 사용자 의도 트리를 생성한다. 이 의도 트리의 정보를 기존의 키워드 빈도 수에 근거한 문서분류 과정에 제약 및 보충 정보로 사용하여 사용자의 의도에 더욱더 근접한 웹 문서를 분류할 수 있다. 문서를 분류하는 측면에서 볼 때 구조화된 사용자 의도 정보는 단순한 키워드의 한계를 극복하여 문서 분류 과정에서 특정 키워드 빈도수의 임계값을 결정함으로서 잃게되는 문서 및 정보를 좀더 보유하고 재적용할 수 있게 된다. 질의에서 분석, 추출된 사용자 의도 트리는 기존의 통계 및 확률을 사용한 문서 분류기법들과 조합하여 사용자 의도정보를 제공함으로서 카테고리의 형성 방향과 범위를 결정하는데 높은 효율성을 보인다.

  • PDF

아웃소싱된 클라우드 데이터의 프라이버시를 보호하기 위한 멀티 키워드 검색 프로토콜의 개선 (An Improved Multi-Keyword Search Protocol to Protect the Privacy of Outsourced Cloud Data)

  • 김태연;조기환;이영록
    • 정보처리학회논문지:컴퓨터 및 통신 시스템
    • /
    • 제6권10호
    • /
    • pp.429-436
    • /
    • 2017
  • 최근 클라우드 컴퓨팅 환경에서 민감하거나 중요한 데이터를 아웃소싱하는 경향이 늘어나고 있다. 하지만 아웃소싱된 데이터의 프라이버시 보호는 매우 중요하다. 지금까지 단일 데이터 소유자와 다수의 데이터 사용자로 구성된 클라우드 컴퓨팅 환경에서 안전하고 효율적인 멀티 키워드 검색 구조들이 다양하게 제안되었다. Zhang 등은 다수의 데이터 소유자들과 사용자들로 연결된 클라우드 컴퓨팅 환경에서 멀티 키워드를 기반으로 하는 검색 프로토콜을 제안하였다. 그들의 프로토콜은 두 가지 문제점을 동시에 안고 있다. 하나는 클라우드 서버가 키워드 인덱스와 사용자의 트랩도어를 통해 데이터 파일들 간의 연관성을 불법적으로 추론할 수 있다는 것이고, 다른 하나는 키워드 인덱스의 크기만큼 복잡한 연산을 수행해야 하기 때문에 사용자의 요청에 대한 응답이 지연된다는 것이다. 본 논문에서는 클라우드 서버를 전적으로 신뢰할 수 없는 노드라는 가정 하에서 우리는 아웃소싱된 데이터의 프라이버시가 보호되는 개선된 멀티 키워드 기반 검색 프로토콜을 제안한다. 그리고 제안된 프로토콜이 Zhang의 프로토콜보다 데이터 파일들 간의 연관성 추론 측면에서 더 안전하고, 처리 시간의 측면에서 더 효율성이 높음을 실험을 통해 보인다.

개인화된 사용자 학습을 위한 연관 객체 추출 설계 및 구현 (Assocate Object Extraction Using personalized user Learning)

  • 유수경;김교정
    • 한국멀티미디어학회:학술대회논문집
    • /
    • 한국멀티미디어학회 2004년도 춘계학술발표대회논문집
    • /
    • pp.636-639
    • /
    • 2004
  • 본 논문은 웹 도큐먼트를 기반으로 사용자에게 의미 있는 정보를 찾아주기 위한 연관 객체 추출 기법인 PMPL(Personalized Multi-Strategey Pattern Loaming) 시스템을 제안하고자 한다. PMPL 모듈은 인터넷의 정보를 여과하여 필터링하고, 사용자 개인화의 키워드를 중심으로 연관된 객체를 추출한다. 이때 연관된 객체 추출 시 대용량 데이터에서 시간적, 공간적면에서 효율적인 연관 탐색 기법인 Fp-Tree와 Fp-Growth 알고리즘을 적용시켰으며, 연관규칙 탐색을 보완하기 위해 가중치 기법인 만유인력 기법을 적용시켰다. PMPL 시스템을 실행한 결과 개인화된 사용자 중심어 기초로 기존의 단일 학습 기법에 비해 더 많은 의미 있는 연관 지식을 추출한 결과가 보였다.

  • PDF