• 제목/요약/키워드: 텍스트 데이터 분석

검색결과 1,103건 처리시간 0.028초

워드 임베딩 기반 연구 논문 분류 기법 (Research Paper Classification Scheme based on Word Embedding)

  • 비스와스 딥또;길준민
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2021년도 추계학술발표대회
    • /
    • pp.494-497
    • /
    • 2021
  • 텍스트 분류(text classification)는 원시 텍스트 데이터로부터 정보를 추출할 수 있는 기술에 기반하여 많은 양의 텍스트 데이터를 관심 영역으로 분류하는 것으로 최근에 각광을 받고 있다. 본 논문에서는 워드 임베딩(word embedding) 기법을 이용하여 특정 분야의 연구 논문을 분류하고 추천하는 기법을 제안한다. 워드 임베딩으로 CBOW(Continuous Bag-of-Word)와 Sg(Skip-gram)를 연구 논문의 분류에 적용하고 기존 방식인 TF-IDF(Term Frequency-Inverse Document Frequency)와 성능을 비교 분석한다. 성능 평가 결과는 워드 임베딩에 기반한 연구 논문 분류 기법이 TF-IDF에 기반한 연구 논문 분류 기법보다 좋은 성능을 가진다는 것을 나타낸다.

남도 문화 축제 멀티미디어 컨텐츠 데이터베이스 설계 (The Design of Constructing Multimedia Database System ; Focused on Namdo's Culture Festival)

  • 최훈;김광석;최석원
    • 한국산업정보학회:학술대회논문집
    • /
    • 한국산업정보학회 2000년도 추계공동학술대회논문집
    • /
    • pp.431-439
    • /
    • 2000
  • 현재 웹(Web)환경에서 운영되고 있는 많은 데이터베이스 중 대부분은 텍스트를 기반으로 운영되고 있다. 이러한 데이터베이스들은 많은 정보들을 제공한다는 장점을 가지고 있지만 텍스트를 기반으로 하고 있기 때문에 사용자들에게 지루함을 제공하고 있고, 하이퍼링크로 정보를 제공하고 있어 사용자들이 직접 원하는 정보들을 찾아다녀야만 한다는 단점을 가지고 있다. 현재 데이터베이스의 흐름은 텍스트 위주의 데이터베이스에서 멀티미디어 컨텐츠 데이터베이스로 변해가고 있고, 직접 정보를 찾는 하이퍼링크 방식에서 질의(Query)를 이용하여 사용자들이 원하는 정보를 검색하는 방식을 채택하고 있다. 본 논문에서는 남도 문화 축제를 중심으로 기존의 텍스트 데이터베이스와 더불어 동영상, 음향 등의 멀티미디어 데이터를 제공하는 멀티미디어 컨텐츠 데이터베이스를 설계하고자 한다. 본 연구에서는 먼저 텍스트 기반의 데이터베이스를 비교ㆍ분석한 후에, 이를 토대로 하여 남도 문화축제의 멀티미디어 컨텐츠 데이터베이스 설계를 제안하였다.

  • PDF

Implementation of AESA Radar Integration Analysis System by using Heterogeneous Media

  • Min-Jung Kang
    • 한국컴퓨터정보학회논문지
    • /
    • 제29권3호
    • /
    • pp.117-125
    • /
    • 2024
  • 본 논문은 다양한 매체를 활용하여 레이다 개발에 특화된 능동 전자 주사식 위상 배열(AESA, Active Electronically Scanned Array) 레이다 통합 분석 시스템을 구현하고 제안한다. 대부분 분석 시스템은 결함의 원인을 분석하고 개선하기 위해 활용되어 시험을 수월하게 한다. 그러나 기존에 텍스트 기반의 로그 분석 시스템은 로그 정보가 많으면 직관적이지 않고 원하는 정보를 한 번에 찾기 어려워 장비 결함 발생 시 결함의 원인을 분석하기에는 한계가 있다. 따라서 본 논문의 분석 시스템은 다양한 매체를 활용한다. 본 논문에서 정의하는 매체란 텍스트 기반의 데이터를 기록하고, 데이터를 이미지 및 영상으로 전시하며 데이터를 시각화하는 것을 말한다. 제안하는 분석 시스템은 레이다 장치 간에 송수신된 데이터, 레이다 표적 탐지 추적 알고리즘 데이터 등을 분류하여 저장하고 레이다 작동 결과 및 장비 결함 정보를 실시간 전시하고 시각화한다. 이 분석 시스템을 통해 사용자에게 원하는 정보를 빠르게 제공하고 완성도 높은 레이다 개발에 도움을 준다.

소셜미디어 빅데이터의 텍스트 마이닝과 오피니언 마이닝 기법을 활용한 웹드라마 분석과 제안 (Webdrama Analysis and Recommendation using Text Mining and Opinion Mining Technique of Social Media)

  • 오세종;김치호
    • 만화애니메이션 연구
    • /
    • 통권44호
    • /
    • pp.285-306
    • /
    • 2016
  • 1인 스마트폰 사용으로 웹툰, 웹소설, TV드라마는 생산자에서 소비자에게 직접적으로 소비할 수 있는 Direct-to-Consumer로 전환되고 있다. 특히, 포털사이트의 웹드라마는 새로운 미디어로 급성장하고 있다. '연애세포', '0시의 그녀', '최고의 미래', '우리 옆집에 EXO가 산다' 등을 TV드라마의 시청률처럼 조회수, 유입자, 댓글, 좋아요 등으로 다양한 반응을 분석할 수 있다. 분석 방법은 소셜미디어 빅데이터의 텍스트 마이닝 기법과 오피니언 마이닝 기법으로 작품을 분석했다. 즉, 웹드라마 마다의 특정 키워드를 추출하고, 추출한 키워드의 긍정, 부정, 중립 등 시청자의 감정을 예측할 수도 있다. 주요 인기 웹드라마를 분석한 결과로는 이미 팬을 확보한 K-Pop 아이돌 멤버의 출현과 포털사이트의 편성 회사와의 연관성이 재생수, 유입자, 댓글, 좋아요에 큰 영향을 미치는 것으로 나타났다. 또한 TV 이외의 매체로 '모바일 TV'의 영향력을 증명하였다. 한계점으로는 모바일 특화 콘텐츠 확보와 비즈니스 모델을 정립하는 것이 필요하겠다. 이 부분을 해결한다면, 한국은 웹드라마의 콘텐츠 강국이라는 긍정적 이미지를 보여줄 수 있는 계기가 될 것이다.

텍스트 마이닝 기법을 활용한 기후변화관련 식품분야 논문초록 분석 (Analysis of the abstracts of research articles in food related to climate change using a text-mining algorithm)

  • 배규용;박주현;김정선;이영섭
    • Journal of the Korean Data and Information Science Society
    • /
    • 제24권6호
    • /
    • pp.1429-1437
    • /
    • 2013
  • 빅 데이터 분석기법 중 비정형데이터 분석기법인 텍스트 마이닝 기법을 이용하여 기후변화 관련 식품분야 논문 초록에서 용어들의 출현빈도를 분석하였다. 이를 위하여 용어-문헌 행렬을 만들고, 용어들간의 비유사성 측도를 바탕으로 계층적 군집분석기법을 적용하여 문서들을 군집화하였다. 군집화된 문서들간의 상호 연관성과 군집별로 특정용어의 빈도를 파악하여 문서군집을 특정주제별로 분류하였다. 이러한 연구를 통하여 식품분야의 기후변화 관련 논문들의 추세와 관심주제어를 파악할 수 있었으며, 향후 기후변화 적응 및 대응 체계 로드맵 작성 시 연구 개발 기초 자료로 활용할 수 있을 것이다.

Web of Science 빅데이터를 활용한 텍스트 마이닝 기반의 정보윤리 이슈 탐색 (Exploring Information Ethics Issues based on Text Mining using Big Data from Web of Science)

  • 김한성
    • 컴퓨터교육학회논문지
    • /
    • 제22권3호
    • /
    • pp.67-78
    • /
    • 2019
  • 본 연구의 목적은 Web of Science(WoS)에서 제공하는 학술 빅데이터를 활용하여 정보윤리 이슈를 탐색하고 향후 정보과 정보윤리 교육을 위한 시사점을 제공하는 것에 있다. 이를 위해 WoS에서 제공하는 학술논문 중 정보윤리와 관련해 출판된 318편의 논문을 텍스트 마이닝 하였다. 구체적으로는 R을 활용해 주요키워드에 대한 빈도 분석(TF, DF, TF-IDF), 토픽 모델링 기반의 정보윤리 이슈 분석, 그리고 각 이슈에 대한 연도별 출연 빈도를 분석하여 정보윤리 연구의 경향성을 탐색하였다. 주요 결과를 살펴보면 다음과 같다. 첫째, TF-IDF를 통해 'digital', 'student', 'software', 'privacy' 등의 단어가 주요 키워드임을 확인하였다. 둘째, 토픽 모델링 분석 결과, 'Professional value', 'Cyber-bullying', 'AI and Social Impact' 등을 포함한 총 8개 이슈로 분석되었고, 그 중, 'Professional value'와 'Cyber-bullying' 이슈가 상대적으로 높은 비율을 차지하고 있었다. 본 연구는 이러한 분석 결과를 기초로 우리나라 정보윤리 교육을 시사점을 논의하였다.

AI 및 텍스트 마이닝 기법을 활용한 지반조사보고서 데이터 추출 자동화 (Automated Data Extraction from Unstructured Geotechnical Report based on AI and Text-mining Techniques)

  • 박지민;서완혁;서동희;윤태섭
    • 한국지반공학회논문집
    • /
    • 제40권4호
    • /
    • pp.69-79
    • /
    • 2024
  • 현장 지반정수 데이터는 다양한 현장 및 실내시험을 통해 획득된 후 지반조사보고서의 형태로 작성되어 유통된다. 효율적인 설계 및 시공을 위해선 지반정수의 디지털 데이터베이스화가 필수적이나, 현재 지반조사보고서 데이터는 수동 입력 방식으로 많은 시간과 인력이 소요되며, 오류가 발생하기도 한다. 본 연구는 이미지 기반 딥러닝 모델 및 텍스트 마이닝 기법을 사용하여 지반조사보고서에서 데이터를 자동으로 추출하는 방법을 제안하였다. 딥러닝 기반의 페이지 분류 모델과 텍스트 서칭 알고리즘을 사용하여 지반조사보고서 부록 내 세부 지반시험 결과 보고서를 100%의 정확도로 분류할 수 있었다. 컴퓨터 비전 알고리즘을 통해 보고서 페이지 내 유효한 데이터 영역을 결정하고, 텍스트 분석을 통해 추출 데이터 항목과 상응하는 지반 데이터를 짝지어 데이터를 추출했다. 제안한 모델은 205개의 지반조사 보고서로 구성된 데이터셋을 통해 검증되었으며, 평균 93.0%의 데이터 추출 정확도를 기록하였다. 마지막으로, 추출 모델의 실무 적용성을 위해 사용자 인터페이스 기반 프로그램을 개발하였다. 프로그램 내 사용자 상호작용을 통해 지반조사보고서 PDF 파일을 업로드하고 자동으로 보고서를 분석 및 데이터를 추출, 편집할 수 있도록 했다. 이를 통해 지반조사보고서의 디지털화 및 지반 데이터베이스 구축이 더욱 효율적이고 정확하게 이루어질 수 있을 것으로 판단된다.

텍스트 마이닝과 소셜 네트워크 분석 기법을 활용한 소비자의 의복 맞음새(Fit)평가에 영향을 미치는 특성 (Using Text Mining and Social Network Analysis to Identify Determinant Characteristics Affecting Consumers' Evaluation of Clothing Fit)

  • 황수현;박주연
    • 감성과학
    • /
    • 제26권1호
    • /
    • pp.101-114
    • /
    • 2023
  • 본 연구의 목적은 텍스트 마이닝과 소셜 네트워크 분석을 활용한 소비자 맞음새 평가의 주요 특징을 규명하는 것이다. 이를 위해 SNS에서 수집된 소비자의 2,000여건의 의복 맞음새 평가 후기로부터 의복 맞음새 관련된 텍스트 데이터를 추출하고 의미연결망 분석과 CONCOR 분석을 수행하였다. 연구 결과, '팬츠'와 '스커트'가 많은 맞음새평가어를 공유하며 다양한 형태로 평가되는 것을 확인하였고 의복의 길이가 가장 많이 평가되었다. 인체부위 중 '허리'는 다양한 의복의 맞음새를 평가하는 가장 중요한 부분이며 의복 맞음새평가어 중 '넓은', '큰', '와이드한', '긴' 등이 가장 많이 사용되는 것으로 나타났다. 본 연구는 소비자 맞음새 평가에 사용된 언어의 구조적 관계와 의미를 구체적으로 규명하고 의복 맞음새의 향상을 위한 실증적 기초 자료를 제공하는데 의의가 있다.

상품 리뷰 분석을 통한 사용자 맞춤형 추천 시스템 (Customized recommendation system through product review analysis)

  • 황도연;배상중;김창수;정회경
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2018년도 춘계학술대회
    • /
    • pp.460-461
    • /
    • 2018
  • 전통적인 방식의 추천 시스템은 사용자가 독립적으로 행동한다는 가정하에 개발된 방식이며, 단순하게 상품을 나열하거나 상품의 속성과 사용자의 기호를 연관하는 기능이 부족하여 가독성과 효율성이 떨어지는 문제점이 있다. 이를 해결하기 위해 본 논문에서는 상품 리뷰 데이터를 크롤링을 한 뒤 R을 이용한 텍스트 마이닝 기법을 사용하여 비정형의 리뷰 데이터를 사용자의 구매이력과의 연관 분석을 통해 의미 있는 정보로 가공하여 사용자 맞춤형 정보를 제공하는 시스템을 제안한다. 이를 통해 사용자는 방대한 양의 상품 리뷰 데이터를 분석할 필요 없이 자신에게 필요한 데이터만을 제공받을 수 있게 되어 사용자의 의사결정에 도움 될 것으로 사료된다.

  • PDF

디지털 포렌식 조사를 위한 NLP의 텍스트 전처리 연구 (A study on NLP Text Preprocessing for digital forensic investigation)

  • 이성원;김도현
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2022년도 춘계학술대회
    • /
    • pp.189-191
    • /
    • 2022
  • 현대 사회에서 메신저 서비스는 다른 사람과의 의사소통을 위해 필수적으로 사용되고 있으며 이는 범죄자들도 예외는 아니다. 따라서 메신저 데이터는 디지털 포렌식 조사에서 필수적으로 분석해야 하는 대상이며, 대표적으로 2018년 버닝 썬 게이트, 2019년 N 번 방 사건이 메신저 데이터가 범죄를 해결하는 데 중요한 증거로 활용됐다. 메신저 서비스가 널리 사용됨에 따라 디지털 기기에 대량의 메신저 데이터가 저장되고, 이에 따라 디지털 포렌식 조사 과정에서 메신저 데이터를 분석하는데 많은 시간이 소요되고 있기 때문에 이를 효과적으로 대응하기 위한 텍스트 마이닝 연구가 필요하다. 본 논문에서는 인스턴트 메신저를 대상으로 효과적인 NLP 분석을 하기 위해 인스턴트 메시지의 특성에 따른 다양한 자연어 전처리 방법을 연구한다.

  • PDF