• 제목/요약/키워드: Extracting keyword

검색결과 77건 처리시간 0.024초

비지도학습 기반의 행정부서별 신문기사 자동분류 연구 (A Study on Automatic Classification of Newspaper Articles Based on Unsupervised Learning by Departments)

  • 김현종;유승의;이철호;남광우
    • 한국산학기술학회논문지
    • /
    • 제21권9호
    • /
    • pp.345-351
    • /
    • 2020
  • 행정기관은 정책 대응성을 제고하기 위해 빅데이터 분석에 관심을 기울이고 있다. 빅데이터 중 뉴스 기사는 정책 이슈와 정책에 대한 여론을 파악하는데 중요한 자료로 활용될 수 있다. 한편으로 새로운 온라인 매체의 등장으로 뉴스 기사의 생산은 급격히 증가하고 있어 문서 자동분류를 통해 기사를 수집할 필요가 있다. 그러나 기존 뉴스 기사의 범주와 키워드 검색방법으로는 특정 행정기관 및 부서별로 업무에 관련된 기사를 자동적으로 수집하는 것에 한계가 있었다. 또한 기존의 지도학습 기반의 분류 기법은 다량의 학습 데이터가 필요한 단점을 가지고 있다. 이에 본 연구에서는 행정부서의 업무특징을 포함한 분류사전을 활용하여 기사의 분류를 효과적으로 처리하기 위한 방법을 제안한다. 이를 위해 행정 기관의 업무와 신문기사를 Word2Vec와 토픽모델링 기법으로 부서별 특징을 추출하여 분류사전을 생성하고, 행정 부서별로 신문기사를 자동분류 한 결과 71%정도의 정확도를 얻었다. 본 연구는 행정부서별 신문기사를 자동분류하기 위해 부서별 업무 특징 추출 방법과 비지도학습 기반의 자동분류 방법을 제시하였다는 학문적·실무적 기여점이 있다.

문자 기반 유해사이트 판별 기법 (A Harmful Site Judgement Technique based on Text)

  • 정규철;이진관;이태헌;박기홍
    • 컴퓨터교육학회논문지
    • /
    • 제7권5호
    • /
    • pp.83-91
    • /
    • 2004
  • 본 논문에서 청소년들의 정신 건강을 해치는 유해 정보 사이트를 차단하기 위해 기존 방식이 아닌 내용 기반을 중심으로 하여 중요도가 가장 높은 한 개의 복합 키워드와 정보통신윤리 위원회에서 제시한 유해단어의 가중치를 이용하여 가중치 평균을 더해 유해도를 판단하여 유해 사이트와 일반 사이트를 구별하는 시스템을 구현하였다. 예비 실험을 통해 구해진 유해도의 값 3.5를 유해정보 사이트를 판단하는 기준으로 정한 다음 유해 정보 차단 시스템의 성능 실험을 위해 유해 정보 사이트와 일반 사이트를 각각 무작위로 100개씩 추출해 접속해 본 결과 유해 사이트를 유해 정보 사이트로 판명한 비율이 78%를 보였고 일반 사이트를 일반 사이트로 판명한 비율이 96%가 되어 본 시스템의 유효성을 확인 할 수가 있었다.

  • PDF

동적 연결 그래프를 이용한 자동 문서 요약 시스템 (A Document Summarization System Using Dynamic Connection Graph)

  • 송원문;김영진;김은주;김명원
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제36권1호
    • /
    • pp.62-69
    • /
    • 2009
  • 문서 요약은 쉽고 빠르게 문서의 내용을 파악할 수 있도록 방대한 내용을 가지는 다양한 형태의 문서로부터 핵심 내용만을 추출하거나 생성하여 제공하는 것을 목적으로 한다. 본 논문에서는 효율적 문서 요약을 위해 주어진 문서의 평균 문장 길이(핵심어 개수)를 고려하여 문장 간의 핵심어 유사도를 나타내는 연결 그래프를 생성하고 분석하여 요약을 생성하는 기법을 제안한다. 또한 이러한 기법을 이용하여 응용 프로그램 문서로부터 자동으로 요약을 생성하는 자동 문서 요약 시스템을 개발한다. 제안한 방법의 객관적인 요약 성능 측정을 위해 정확한 요약문이 실린 20개의 테스트 문서를 이용하여 생성된 요약에 대해 precision(정확률)과 recall(재현율), F-measure를 측정하였으며, 실험 결과를 통해 기존 기법에 비해 우수한 요약 성능을 보임을 증명하였다.

이미지 내 텍스트 추출 및 검색을 위한 안드로이드 모바일 시스템 구현 (An Implementation of an Android Mobile System for Extracting and Retrieving Texts from Images)

  • 고은비;하유진;최수렴;이기훈;박영호
    • 디지털콘텐츠학회 논문지
    • /
    • 제12권1호
    • /
    • pp.57-67
    • /
    • 2011
  • 스마트폰의 보급량이 증가하면서 이동성과 휴대성이 강조된 모바일 검색이 주목 받고 있다. 그러나 모바일 검색을 위한 일반적인 키워드 입력 수단은 키패드로 제한되어 있다. 키패드는 모바일 기기가 갖는 이동성과 휴대성에 적합하지 않다는 단점을 갖는다. 이를 보완하기 위해 음성을 이용한 검색이 등장 하였지만, 이 또한 단점을 지니고 있다. 따라서, 본 논문에서는 다양한 상황에서의 정보 접근성을 향상 시키기 위해 이미지를 검색 수단으로 사용하는 검색 시스템을 제안한다. 본 콘텐츠는 안드로이드 플랫폼 기반의 스마트폰에서 이미지를 얻어 텍스트를 추출하고, 이를 검색 엔진의 키워드로 입력하여 그 결과를 출력하는 과정을 거친다. 또한, 검색 결과를 스마트폰의 내장 데이터베이스에 저장하고, 이를 관리하여 추후에 재사용할 수 있도록 한다. 실험을 통해 인식 가능한 이미지의 특성을 분석하고, 본 콘텐츠의 기능을 소개한다.

형태소 분석을 이용한 발화관련 기기의 새로운 입력 키워드 추출 (New Input Keyword Extraction of Equipments Involved in Ignition Using Morphological Analysis)

  • 김은주;최정우;류정우
    • 한국화재소방학회논문지
    • /
    • 제28권2호
    • /
    • pp.91-97
    • /
    • 2014
  • 급변하는 사회에서 기존에는 없었던 새로운 화재 사고가 발생하거나, 또는 과거에는 자주 발생된 화재 사고가 발생하지 않는 경우가 많아지고 있다. 본 논문에서는 화재분류체계를 개선할 때 사용할 수 있는 새로운 명사를 화재조사데이터로부터 추출하는 방법을 제안하였다. 화재조사데이터는 화재 조사관에 의해 작성된 화재사고 관련 데이터이다. 제안한 방법은 기타 소분류에 포함된 화재조사데이터의 제품명과 발화개요를 형태소 분석하여 발화관련 기기의 소분류 범주로 사용할 수 있는 새로운 입력 키워드를 추출하였다. 본 논문에서는 제품명을 분석하여 발화관련 기기 대분류인 농업용장비와 계절용 기기의 새로운 소분류 범주로 "건조기"와 "보일러"를 추출하였다. 또한 발화개요를 분석하여 발화관련 기기 대분류인 상업장비와 영상, 음향기기의 새로운 소분류 범주로 "수족관"과 "모니터"를 추출하였다. 이 네 가지의 새로운 소분류 범주로 화재조사데이터를 재분류하였을 때 총 3,808건 중 14.39%인 548건이 재분류되었다.

국내 십전대보탕 최근 연구 동향 분석 (The Analysis of the Recent Research Trend of Sipjeondabo-tang in Korea)

  • 오소미;전천후;박선주;장보형;박정수;장수빈;신용철;고성규
    • 대한예방한의학회지
    • /
    • 제18권1호
    • /
    • pp.113-123
    • /
    • 2014
  • Objective : This study is aimed to analyze the recent research trend of Sipjeondabo-tang (SJDBT) in Korea. Method : We searched Korean research database by using keyword 'Sipjeondabo-tang'. Databases are Korean Medicine Information System, Research Information Service System and Korean Studies Information Service System. We analyzed studies by research method, publication year, type of journal and subject of the study. Results : By analyzing studies published after 1990, we could find that experimental studies were primarily conducted in SJDBT study. During recent 10 years, the number of toxicity studies and components analysis studies is increasing. Among the SJDBT studies, the number of clinical study was only 1. Conclusion : We explored the recent research trend of SJDBT in Korea. As a result, We suggested three further research ways of SJDBT. Proposed research ways are exploring various effect of SJDBT, observing whether there is a difference of effect according to extracting and drying method, and conducting clinical research of SJDBT.

문서 영상 내 테이블 영역에서의 단어 추출 (Word Extraction from Table Regions in Document Images)

  • 정창부;김수형
    • 정보처리학회논문지B
    • /
    • 제12B권4호
    • /
    • pp.369-378
    • /
    • 2005
  • 문서 영상은 문서 구조 분석을 통하여 텍스트, 그림, 테이블 등의 세부 영역으로 분할 및 분류되는데, 테이블 영역에 있는 단어는 다른 영역의 단어보다 의미가 있기 때문에 주제어 검색과 같은 응용 분야에서 중요한 역할을 한다. 본 논문에서는 문서 영상의 테이블 영역에 존재하는 문자 성분을 단어단위로 추출하는 방법을 제안한다. 테이블 영역에서의 단어 추출은 실질적으로 테이블을 구성하는 셀 영역에서 단어를 추출하는 것이기 때문에 정확한 셀 추출 과정이 필요하다. 셀 추출은 연결 요소를 분석하여 테이블 프레임을 찾아내고, 교차점 검출은 전체가 아닌 테이블 프레임에 대해서만 수행한다. 잘못 검출된 교차점은 이웃하는 교차점과의 관계를 이용하여 수정하고, 최종 교차점 정보를 이용하여 셀을 추출한다. 추출된 셀 내부에 있는 텍스트 영역은 셀 추출 과정에서 분석한 문자성분의 연결 요소 정보를 재사용하여 결정하고, 결정된 텍스트 영역은 투영 프로파일을 분석하여 문자연로 분리된다. 마지막으로 분리된 문자열에 대하여 갭 군집화와 특수 기호 검출을 수행함으로써 단어 분리를 수행한다. 제안 방법의 성능 평가를 위하여 한글 논문 영상으로부터 추출한 총 In개의 테이블 영상에 대해 실험한 결과, $99.16\%$의 단어 추출 성공률을 얻을 수 있었다.

미국 특허 서지정보 추출 방법에 대한 연구: HTML 파싱 기법의 활용을 중심으로 (An Extraction Method of Bibliographic Information from the US Patents: Using an HTML Parsing Technique)

  • 한유진;오승우
    • 정보관리학회지
    • /
    • 제27권2호
    • /
    • pp.7-20
    • /
    • 2010
  • 본 연구는 미국 특허 문서에서 가장 최신의 정보를 추출할 수 있는 방법을 제시하였다. 이를 위해 미국특허청 웹페이지에 직접 접속하여, HTML 문서를 파싱하는 방법을 제시하였다. 먼저 관심 있는 키워드로 검색을 한 후 50개로 이루어진 리스트가 출력되면, HTML 파싱 기법을 이용하여 여기서 직접 특허번호, 출원인, 미국 특허 클래스와 같은 주요 서지정보를 추출할 수 있는 알고리즘을 제안하였다. 또한 미국 특허문서에서 특수하게 제공되는 선.후행 특허간의 관계를 활용해 본 특허와 후행 특허의 미국 특허 클래스를 동시에 추출 할 수 있는 알고리즘도 보여주었다. 본 연구에서 제시한 방법은 몇 가지 한계를 가지지만, 적시성.포괄성 측면에서 이미 존재하는 데이터베이스를 보완할 수 있을 것이다.

가상현실 경험을 복습시켜주는 사진 정리 알고리즘 (The Image Summarization Algorithm for Reviewing the Virtual Reality Experience)

  • 곽은주;조용주;조현상;박경신
    • 정보처리학회논문지B
    • /
    • 제15B권3호
    • /
    • pp.211-218
    • /
    • 2008
  • 이 논문에서 우리는 교육용 가상환경에서 사용자가 직접 촬영한 사진들을 학습 내용과 사용자의 상황 정보를 바탕으로 자동으로 사진을 정리 요약해서 가상 환경 체험이 끝난 후 짧게 보여주는 새로운 사진 정리 알고리즘을 제안한다. 이 알고리즘은 기존의 날짜, 장소, 키워드를 이용하여 많은 양의 사진을 정리 요약해주는 사진 정리 알고리즘과는 달리 사용자의 관심도와 기억해야 할 주요 학습내용을 다시 한 번 살펴보도록 함으로써 기억 향상을 도와주는 것을 목적으로 한다. 본 논문에서는 먼저 학습 효과를 높이기 위해 교육적으로 의미가 있는 사진을 추출하는 기준과 인지율 계산을 설명하고, 이 알고리즘을 가상환경과 사진 뷰어 인터페이스와 연동한 전체적인 시스템을 설명한다. 또한 이 알고리즘에 사용된 인지율 모델링을 위한 사용자 실험 분석과 향후 연구 방향에 대해 논한다.

자연어 처리 기반 맞춤형 트윗 추천 시스템 (Natural Language Processing-based Personalized Twitter Recommendation System)

  • 이현창;유동필;정가빈;남용욱;김용혁
    • 한국융합학회논문지
    • /
    • 제9권12호
    • /
    • pp.39-45
    • /
    • 2018
  • 트위터 사용자는 팔로우, 리트윗 등을 사용하여 자신이 관심 있어 하는 트윗을 찾는다. 하지만 사용자가 3억여 명에 달하는 트위터에서 사용자가 관심 있는 트윗을 찾기는 힘든 일이다. 이를 해결하기 위해 본 논문에서는 사용자 맞춤형 트윗 추천 시스템을 개발하였다. 우선, 사용자에게 추천할 수 있을 만한 가치가 있는 트윗을 수집하기 위해 현재 트랜드를 수집하고, 트랜드에 대해 이야기하는 인기 있는 트윗들을 수집한다. 이후 사용자를 분석하고 맞춤형 트윗을 추천하기 위해 사용자의 트윗과 수집한 트윗을 범주화한다. 최종적으로 웹서비스를 이용하여 사용자에게 본인과 카테고리가 일치하는 트윗과 관심사가 일치하는 사용자를 추천해준다. 결과적으로 67.2%로 적절한 트윗을 추천하였다.