• 제목/요약/키워드: 주제어 기반 분류

검색결과 41건 처리시간 0.025초

독립 운동 컬렉션 분류 체계 개발에 관한 연구 - 공훈전자사료관을 중심으로 - (A Study on the Development of an Independent Movement Collection Classification System: Focus on the Gonghun Digital Archive)

  • 오정희;정연경
    • 한국기록관리학회지
    • /
    • 제18권4호
    • /
    • pp.99-124
    • /
    • 2018
  • 본 연구는 국가보훈처의 '공훈전자사료관' 컬렉션을 기반으로 독립 운동 컬렉션에 대한 출처별, 주제별, 자료유형별 분류 체계를 제안하였다. 먼저 출처별 분류 체계는 계층별로 구성하였으며 출처별로 분류된 기록물들은 관련 주제어에 따라 2차 분류한 후, 17가지 자료유형별로 분류하였고 '출처-주제-자료유형'의 인용 순서로 기술하였다. 또한 주제어를 바탕으로 한 귀납적 방법을 이용하여 유의미한 컬렉션을 도출하였다. 이를 통해 공훈전자사료관 컬렉션을 출처별, 주제별, 자료유형별로 이용자가 기록물을 쉽게 찾을 수 있도록 분류하였다. 본 연구의 결과는 독립 운동 DB 자료의 기록물 검색을 지원하기 위한 분류 체계로서 이용자의 접근성을 높이고 독립 운동 기록물 서비스를 확장하는데 기초가 될 것이다.

실시간 SNS 트렌드 분석에 기반한 이슈 요약 기법 (Issue summarization scheme based on real-time SNS trend analysis)

  • 김대용;김대훈;황인준
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2013년도 추계학술발표대회
    • /
    • pp.1096-1097
    • /
    • 2013
  • 최근 Twitter를 비롯한 소셜 네트워크 서비스의 급속한 확산으로 인해, 많은 수의 SNS 메시지가 실시간으로 생성되고 있다. 이러한 SNS 상의 모든 글을 읽어보는 것은 현실적으로 불가능하며, 여러 포탈 사이트에서 제공되는 실시간 검색어 순위만으로는 상세 내용을 직관적으로 파악하기 어렵다. 따라서, 이러한 SNS상의 글을 실시간으로 분석하여 최신의 트렌드를 찾고 이와 연관된 내용을 분류 및 요약할 수 있다면, 사용자에게 유용한 최신 정보를 생성하여 제공할 수 있다. 본 논문에서는 Tweet 들을 분석하여 얻은 트렌드 키워드를 기반으로 관련된 Tweet 들을 주제 별로 분류한 후, 각 주제 별로 세부 내용을 요약해서 제공하는 기법을 제안한다. 제안하는 기법은 실시간으로 생성되는 Tweet 내에서 최근 화제가 된 트렌드 및 연관 키워드를 추출해낸다. 그 후, 해당 키워드가 출현한 Tweet 내에서 핵심 키워드를 찾고, 이를 기반으로 Tweet 들을 각각의 주제별로 분류하고 각 주제를 '이슈'로 정의한다. 마지막으로, 특정한 이슈에 해당되는 Tweet들을 분석하여 각 이슈 별로 키워드 리스트 및 단문 형식으로 요약된 줄거리를 생성한다. 제안된 기법을 바탕으로 프로토타입 시스템을 구현하고, 다양한 실험을 통하여 이슈 검출 기법의 유용성 면에서 성능을 평가한다.

오피니언 마이닝을 활용한 블로그의 극성 분류 기법 (The Blog Polarity Classification Technique using Opinion Mining)

  • 이종혁;김원상;박제원;최재현
    • 디지털콘텐츠학회 논문지
    • /
    • 제15권4호
    • /
    • pp.559-568
    • /
    • 2014
  • 기존의 감정분석을 통한 극성 분류는 주로 평점을 기반으로 하는 상품평을 기준으로 문장규칙을 이용하여 분석해왔다. 이러한 분석방법은 평점이 없는 블로그 같은 경우 적용되기 어려움 점이 있고 댓글 아르바이트나 관리자에 의해 상품평이 조작될 가능성이 있어서 상품평 만으로는 상품, 매장에 대한 의견을 파악하기에는 어려움이 있다. 이러한 문제점을 고려할 때 개인들의 솔직한 의견이 담겨 있는 블로그를 분석하여 극성을 분류하면 상품, 매장에 대한 올바른 이해가 가능하다. 본 논문은 도메인별로 블로그 글에 대한 고빈도 단어를 추출하여 주제어를 선정하고, 선정된 주제어를 기준으로 제안하는 감정분석 기법을 적용하여 블로그 글에 대한 극성을 분류한다. 감정분석 기법의 성능을 평가하기 위하여 정보 검색 분야에서 사용되는 측정지표 Precision, Recall, F-score를 사용하여 본 연구의 극성 분류기법의 유용성을 검증한다. 평가 결과 기존의 상품평을 문장규칙을 이용하여 분석하여 극성 분류를 하는 기법들에 비해서 제안한 감정분석 기법을 적용할 경우에 우수한 성능으로 극성 분류를 하는 것으로 나타났다.

비음수 행렬 분해와 동적 분류 체계를 사용한 자동 이메일 다원 분류 (Automatic Email Multi-category Classification Using Dynamic Category Hierarchy and Non-negative Matrix Factorization)

  • 박선;안동언
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제37권5호
    • /
    • pp.378-385
    • /
    • 2010
  • 이메일 사용의 증가로 수신 메일을 효율적이면서 정확하게 분류할 필요성이 점차 늘고 있다. 현재의 이메일 분류는 SVM, 베이지안 분류자, 규칙 기반 분류자 등을 이용하여 스팸 메일을 필터링하기 위한 이원 분류가 주를 이루고 있다. 그러나 이러한 지도 학습 방법들은 적합한 이메일을 인식하기 위하여서 사용자가 규칙이나 색인어 목록을 작성해야 한다. 비지도 학습 방법으로 군집을 이용한 다원 분류 방법은 메일의 분류 주제를 설정해주어야 한다. 본 논문에서는 비음수 행렬 분해(NMF, Non-negative Matrix Factorization)를 기반으로 한 자동 분류 주제 생성 방법과, 동적 분류 체계(DCH, Dynamic Category Hierarchy) 방법을 이용한 분류 주제 내에 이메일을 재구성하는 방법을 결합한 새로운 이메일 다원 분류 방법을 제안한다. 이 방법은 수신되는 이메일을 자동으로 다원 분류하여 대량의 메일을 효율적으로 관리할 수 있으며, 사용자가 분류 결과를 만족하지 못하면 분류 주제 내의 이메일을 동적으로 재구성하여 분류의 정확률을 높인다.

상호운용적 분류체계 관리를 위한 반자동 분류체계 관리방안 (Semi-Automatic Management of Classification Scheme with Interoperability)

  • 이원구;신성호;김광영;정도헌;윤화묵;성원경;이민호
    • 한국콘텐츠학회논문지
    • /
    • 제11권12호
    • /
    • pp.466-474
    • /
    • 2011
  • 과학기술의 융 복합현상은 21세기 지식 기반 경제하에서 더욱 활발하게 진행됨에 따라 과학기술 분야를 적절히 분류해내고, 미래의 신성장 분야까지 포용할 수 있는 체계를 만드는 것이 결코 쉽지 않다. 이에, 본 연구에서는 각 콘텐츠 관리 서비스 기관이 분류체계 간 상호운용성을 갖을 수 있도록 반자동적인 입수/관리 분류체계 이력관리 및 입수-관리 분류체계 간 매핑 방안을 시스템적 측면에서 제시하였으며, 이를 통해, 기존의 수작업 방식에서 발생할 수 있는 관리적 어려움과 비용적 발생을 최소화할 수 있을 것이다.

베이지안 추론망 기반 색인어의 심층 분석 방법 (Deep Analysis on Index Terms Using Baysian Inference Network)

  • 송사광;이승우;정한민
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2012년도 제24회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.84-87
    • /
    • 2012
  • 대분분의 검색 엔진에서 색인어의 추출 및 가중치의 부여방법은 매우 중요한 연구주제로, 검색 엔진의 성능에 큰 영항을 미친다. 일반적으로, 불용어 리스트를 통해 성능에 긍정적인 영향을 미치지 않는 색인어를 제거하거나, 핵심어 또는 전문용어 등 상대적으로 중요한 색인어를 강조하는 방식을 사용하여 검색엔진의 성능을 향상시킨다. 하지만, 어절 분리, 형태소 분석, 불용어 처리 등 검색엔진의 단계열 처리 과정에서, 개별적인 색인어가 검색엔진에 미치는 영향을 분석하고 이를 반영한 검색 엔진 성능 향상 기법은 제시되지 않고 있다. 따라서 본 연구에서는 각 단계별 처리 과정에서 생성된 색인어가 미치는 영항을 계랑화하여 긍정적/부정적 색인어를 분류하는 방법론을 소개하고, 이를 기반으로 색인어 가중치를 조절함으로써 검색 엔진의 성능 또한 향상 가능한 방법을 소개한다.

  • PDF

문서 구조 정보에 기반한 웹 페이지 범주화 모델 (A Web Page Categorization Model Based on Document Structural Information)

  • 정성화;이종혁
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1998년도 제10회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.91-96
    • /
    • 1998
  • 본 논문에서는 주제범주 체계를 이용한 웹 검색이 가지는 장점을 이용 할 수 있도록 인터넷 웹 페이지들을 주제범주 체계에 따라 자동으로 분류하는 모델을 제시한다. 특히 웹 페이지 작성자들의 의도를 범주화에 반영할 수 있는 방법으로 HTML 태그를 이용한다. 즉 웹 페이지의 표현에 있어서 벡터 스페이스 모델에서의 색인어 빈도 가중치에 태그 가중치를 추가 하여 보다 좋은 성능을 얻도록 하였다. 그리고 주제범주를 표현하는데 사용되는 자질의 선정에는 기대상호정보, 상호정보 척도를, 문서간 유사도 비교에는 최근린법을 사용하였다. 전북대에서 정보탐정용으로 분류한 웹 페이지를 대상으로 실험하였으며, 기본 모델 대비 약 7%의 정확도 향상을 얻을 수 있었다.

  • PDF

키워드 추출과 군집화 기반의 논문 분류 시스템의 설계 및 구현 (Design and Implementation of Paper Classification Systems based on Keyword Extraction and Clustering)

  • 이윤수;테이퍼악떠라;이종혁;길준민
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2018년도 춘계학술발표대회
    • /
    • pp.48-51
    • /
    • 2018
  • 컴퓨터 및 기술의 발전으로 힘입어 수많은 논문이 오프라인뿐 아니라 온라인으로 발행되고 있고, 새로운 분야들도 계속 생기면서 사용자들은 방대한 논문들 중 자신이 필요로 하는 논문을 검색하거나 분류하기에 많은 어려움을 겪고 있다. 이러한 한계를 극복하기 위해 본 논문에서는 유사 내용의 논문을 분류하고 이를 군집화하는 방법을 제안한다. 제안하는 방법은 TF-IDF를 이용하여 각 논문의 초록으로 부터 대표 주제어를 추출하고, K-means 클러스터링 알고리즘을 이용하여 추출한 TF-IDF 값을 근거로 논문들을 유사 내용의 논문으로 군집화한다.

에세이의 창의성 분류를 위한 어텐션과 역문서 빈도 기반의 자기부호화기 모델 (An AutoEncoder Model based on Attention and Inverse Document Frequency for Classification of Creativity in Essay)

  • 정세진;김덕기;온병원
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2022년도 제34회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.624-629
    • /
    • 2022
  • 에세이의 창의성을 자동으로 분류하는 기존의 주요 연구는 말뭉치에서 빈번하게 등장하지 않는 단어에 초점을 맞추어 기계학습을 수행한다. 그러나 이러한 연구는 에세이의 주제와 상관없이 단순히 참신한 단어가 많아 창의적으로 분류되는 문제점이 발생한다. 본 논문에서는 어텐션(Attention)과 역문서 빈도(Inverse Document Frequency; IDF)를 이용하여 에세이 내용 전달에 있어 중요하면서 참신한 단어에 높은 가중치를 두는 문맥 벡터를 구하고, 자기부호화기(AutoEncoder) 모델을 사용하여 문맥 벡터들로부터 창의적인 에세이와 창의적이지 않은 에세이의 특징 벡터를 추출한다. 그리고 시험 단계에서 새로운 에세이의 특징 벡터와 비교하여 그 에세이가 창의적인지 아닌지 분류하는 딥러닝 모델을 제안한다. 실험 결과에 따르면 제안 방안은 기존 방안에 비해 높은 정확도를 보인다. 구체적으로 제안 방안의 평균 정확도는 92%였고 기존의 주요 방안보다 9%의 정확도 향상을 보였다.

  • PDF

디지털미디어 기반 미술 정보 활용 방안 연구 - 미술 감상 모바일 애플리케이션을 중심으로 - (A Study on the Use of Art Information Based on Digital Media - Focusing on Art Appreciation Mobile Application -)

  • 허유경;박승호
    • 디자인융복합연구
    • /
    • 제15권5호
    • /
    • pp.1-19
    • /
    • 2016
  • 디지털 매체의 등장은 기존의 미술 정보 아카이빙(archiving)을 기준으로 관람객의 적극적인 개입을 가능하게 만들었다. 그럼에도 관객들은 미술관이 제공하는 정보를 해석하는 데에 어려움을 느끼고 있다. 이에 따라 본 연구는 미술관이 구축해온 아카이빙 자료가 디지털 매체를 기반으로 관객에게 유의미하게 전달 될 수 있는 정보 가이드라인을 제안하는 것을 목표로 진행되었다. 이를 위해 현재 제공되는 디지털 기반 미술 정보 제공 서비스 중 모바일의 사례를 크게 후퍼 그린힐(Hooper-Greenhill, E)의 주제어를 기반으로 콘텐츠 맥락의 측면과 정보 전달 방식, 기능의 측면에서 분석하였다. 이 후 분류된 세부 주제어들을 관람객의 감상 단계에 입각해 재배열 하였고, 재구성된 정보의 구조는 미술관이 주체가 된 정보의 유형화와 제공이 아닌 관람객의 이해 단계를 주체로 한 정보 구조를 구축했다는 데에 그 의의가 있다. 본 연구에서 제안한 미술 정보 활용 방안은 향 후 웹을 기반으로 한 미술관의 트랜스미디어 스토리텔링의 실제적 서비스 구축의 구체적 방향 설정에 도움이 될 수 있을 것이라 기대한다.