• 제목/요약/키워드: Latent Dirichlet allocation

검색결과 216건 처리시간 0.025초

스토킹 관련 언론기사에 대한 텍스트네트워크분석 (Text Network Analysis on Stalking-Related News Articles )

  • 지은선;정상희
    • 문화기술의 융합
    • /
    • 제9권3호
    • /
    • pp.579-585
    • /
    • 2023
  • 본 연구의 목적은 텍스트네트워트분석을 통해 스토킹에 대한 정치성향의 언론기사 내에 핵심 단어를 탐색하고 내재된 의도를 살펴보는 것이다. 2018년 1월 1일부터 2022년 12월 31일까지 보도된 보수언론기사(조선일보, 중앙일보) 824건, 진보언론기사(한겨레신문, 경향신문) 783건으로 총 1,607건을 선정하여 LDA(Latent Dirichlet Allocation) 기반의 토픽모델링 기법으로 도출된 주제범주의 양상을 탐색하였다. 연구결과는 보수언론과 진보언론의 공통된 토픽은 젠더폭력의 인식개선, 신변보호 및 처벌강도, 스토커 신상공개 도출되었고 두 언론의 상이한 토픽은 보수언론에서는 스토커의 가해행위, '신당역 살인사건'의 개요와 진보언론은 '신당역 살인사건'의 가중처벌요구, (사이버공간의) 성착취 범죄 근절로 구성되었다. 본 연구는 스토킹에 대한 언론기사 간의 이념적 의견에 따라 보도형태에 변화가 있음을 시사한다.

팬데믹 기간 Messenger 애플리케이션 리뷰 변화를 통한 서비스 전략 분석 : 토픽 모델링을 중심으로 (Analysis of service strategies through changes in Messenger application reviews during the pandemic: focusing on topic modeling)

  • 이유나;노미진;김양석;한무명초
    • 스마트미디어저널
    • /
    • 제12권6호
    • /
    • pp.15-26
    • /
    • 2023
  • COVID-19 팬데믹 영향으로 대면 소통이 어려워지면서 비대면 소통의 영향을 파악하는 연구가 진행되고 있으나 메신저 애플리케이션 리뷰를 통해 이를 살펴본 연구는 미비하다. 본 연구는 구글 플레이 스토어 내의 메신저 애플리케이션 리뷰 데이터를 수집하여 LDA(Latent Dirichlet Allocation)토픽 모델링을 통해 팬데믹의 영향을 파악하고, 이에 따른 서비스 전략 방안을 제시하고자 한다. 연구에서는 팬데믹이 시작된 시점과 사용자가 부여한 평점을 기준으로 데이터를 분류하였다. 분석 결과 주로 중장년층이 메신저를 사용하는 것으로 나타났으며, 팬데믹 이후에는 가족과의 소통이 증가한 것으로 확인되었다. 사용자들은 애플리케이션의 업데이트에 대해 불만을 표현하였으며, 변화에 대한 적응이 어려움을 보였다. 이에 업데이트 주기를 조정하고 사용자들의 의견을 적극 수용하는 개발접근이 필요하다. 또한, 직관적이고 간편한 사용자 인터페이스(UI)를 제공한다면 사용자 만족도를 향상시킬 수 있을 것으로 기대된다.

LDA 및 BERTopic 기반 해외건설시장 뉴스 기사 토픽모델링 성능평가 (Evaluation of Topic Modeling Performance for Overseas Construction Market Analysis Using LDA and BERTopic on News Articles)

  • 백준우;정세환;지석호
    • 대한토목학회논문집
    • /
    • 제43권6호
    • /
    • pp.811-819
    • /
    • 2023
  • 해외건설사업 시, 현지 상황을 정확하고 빠르게 파악하는 것은 프로젝트 성공을 위해 매우 중요한 요소이다. 이는 토픽모델링을 활용한 뉴스 기사 분석을 통해 실현될 수 있다. 본 연구는 Latent Dirichlet Allocation(LDA)과 BERTopic 두 토픽모델링 기법을 활용하여 뉴스 기사를 분석하고, 최적의 기법을 찾고자 하였다. 모델링 결과로 자동생성된 토픽과 실제 문서 주제와의 일치 여부를 확인하기 위해 BBC 뉴스 기사 6,273건 을 수집하여 ground truth를 생성하고, 이를 모델링된 토픽과 비교하였다. 그 결과 LDA의 F1 score는 0.011, BERTopic은 0.244로 나타났다. 이를 통해 BERTopic이 실제 뉴스 기사의 주제를 잘 파악하며, 해외건설시장의 주요 이슈를 자동으로 이해하는 데 더욱 용이하다는 것을 확인할 수 있었다

An Analysis of Artificial Intelligence Education Research Trends Based on Topic Modeling

  • You-Jung Ko
    • 한국컴퓨터정보학회논문지
    • /
    • 제29권2호
    • /
    • pp.197-209
    • /
    • 2024
  • 본 연구의 목적은 국내 인공지능 교육의 최근 연구 동향을 분석하여 향후 인공지능 교육의 방향성을 모색하는 것이다. 2016년부터 2023년 11월까지 RISS(Research Information Sharing Service)에 게재된 논문 중 인공지능 교육 관련 논문 697편을 대상으로 워드 클라우드(Word Cloud)와 LDA 토픽 모델링(Latent Dirichlet Allocation Topic Modeling) 기법을 활용하여 분석하였다. 분석결과, 주요 토픽으로는 생성형 인공지능 활용 교육, 인공지능 윤리 교육, 인공지능 융합 교육, 인공지능 활용에 대한 교사 인식과 역할, 대학 교육에서 인공지능 리터러시(Literacy) 개발, 인공지능 기반 교육과 연구 방향으로 여섯 가지가 도출되었다. 분석결과를 토대로, (1) 다양한 교과목에 생성형 인공지능 활용 확대, (2) 인공지능 사용을 위한 윤리적 지침, (3) 인공지능 교육의 장기적 영향 평가, (4) 고등교육에서 교사의 인공지능 활용 역량, (5) 대학의 인공지능 교육과정 다양화, (6) 인공지능 연구 추이 분석 및 교육 플랫폼(Platform) 개발 등을 제안하였다.

신문기사 빅데이터를 활용한 친환경 섬유의 추이에 관한 연구 (The Trends of Eco-Friendly Textiles Using Big Data from Newspaper Articles)

  • 조남범;이충권
    • 스마트미디어저널
    • /
    • 제13권2호
    • /
    • pp.95-107
    • /
    • 2024
  • 환경에 친화적인 제품과 서비스의 개발은 시대적인 트렌드가 되었고, 경제적 가치를 가진 친환경 섬유의 개발과 활용은 새로운 비즈니스 모델로서 주목받고 있다. 친환경 섬유에 대한 동향을 분석하고 추이를 파악하는 것은 기업, 정부, 소비자 등 다양한 이해관계자들에게 중요한 정보와 인사이트를 제공하여 지속가능한 성장에 도움을 줄 수 있다. 이에 본 연구는 2000년부터 2023년 6월까지 섬유패션 분야를 주로 다루는 신문의 기사데이터를 수집하여 분석을 진행하였다. '친환경 섬유'라는 키워드가 포함된 기사 총 12,331건을 수집하였고, 추출된 데이터에서 형태소 분석을 진행 후 연도별 토픽을 알아보기 위해 잠재 디리클레 할당과 동적 토픽 모델링 분석을 수행하였다. 연구 결과는 섬유산업의 지속 가능한 발전을 위한 전략적 지침과 인사이트를 제공함으로써, 친환경 섬유의 연구와 개발, 그리고 상용화를 촉진함에 있어서 도움이 될 것으로 기대된다.

KOSPI index prediction using topic modeling and LSTM

  • Jin-Hyeon Joo;Geun-Duk Park
    • 한국컴퓨터정보학회논문지
    • /
    • 제29권7호
    • /
    • pp.73-80
    • /
    • 2024
  • 본 연구는 토픽 모델링과 장단기 기억(LSTM) 신경망을 결합하여 한국 종합주가지수(KOSPI) 예측의 정확도를 향상하는 방법을 제안한다. 본 논문에서는 LDA(Latent Dirichlet Allocation) 기법을 이용해 금융 뉴스 데이터에서 금리 인상 및 인하와 관련된 10개의 주요 주제를 추출하고, 추출된 주제를 과거 KOSPI 지수와 함께 LSTM 모델에 입력하여 KOSPI 지수를 예측하는 모델을 제안한다. 제안된 모델은 과거 KOSPI 지수를 LSTM 모델에 입력하여 시계열 예측 방법과 뉴스 데이터를 입력하여 토픽 모델링하는 방법을 결합하여 KOSPI 지수를 예측하는 특성을 가진다. 제안된 모델의 성능을 검증하기 위해, 본 논문에서는 LSTM의 입력 데이터의 종류에 따라 4개의 모델(LSTM_K 모델, LSTM_KNS 모델, LDA_K 모델, LDA_KNS 모델)을 설계하고 각 모델의 예측 성능을 제시하였다. 예측 성능을 비교한 결과, 금융 뉴스 주제 데이터와 과거 KOSPI 지수 데이터를 입력으로 하는 LSTM 모델(LDA_K 모델)이 가장 낮은 RMSE(Root Mean Square Error)를 기록하여 가장 좋은 예측 성능을 보였다.

BART 기반 문서 요약을 통한 토픽 모델링 성능 향상 (Performance Improvement of Topic Modeling using BART based Document Summarization)

  • 김은수;유현;정경용
    • 인터넷정보학회논문지
    • /
    • 제25권3호
    • /
    • pp.27-33
    • /
    • 2024
  • 정보의 증가 속에서 학문 연구의 환경은 지속적으로 변화하고 있으며, 이에 따라 대량의 문서를 효과적으로 분석하는 방법의 필요성이 대두된다. 본 연구에서는 BART(Bidirectional and Auto-Regressive Transformers) 기반의 문서 요약 모델을 사용하여 텍스트를 정제하여 핵심 내용을 추출하고, 이를 LDA(Latent Dirichlet Allocation) 알고리즘을 통한 토픽 모델링의 성능 향상 방법을 제시한다. 이는 문서 요약을 통해 LDA 토픽 모델링의 성능과 효율성을 향상시키는 접근법을 제안하고 실험을 통해 검증한다. 실험 결과, 논문 데이터를 요약하는 BART 기반 모델은 Rouge-1, Rouge-2, Rouge-L 성능 평가에서 각각 0.5819, 0.4384, 0.5038의 F1-Score를 나타내어 원문의 중요 정보를 포착하고 있음을 보인다. 또한, 요약된 문서를 사용한 토픽 모델링은 Perplexity 지표를 통한 성능 비교에서 원문을 사용한 토픽 모델링의 경우보다 약 8.08% 더 높은 성능을 보인다. 이는 토픽 모델링 과정에서 데이터 처리량의 감소와 효율성 향상에 기여한다.

토픽모델링을 이용한 국내 미세먼지 연구 분류 및 연구동향 분석 (A Study on the Research Topics and Trends in South Korea: Focusing on Particulate Matter)

  • 박혜민;김태용;권대웅;허준용;이주연;양민준
    • 대한원격탐사학회지
    • /
    • 제38권5_3호
    • /
    • pp.873-885
    • /
    • 2022
  • 전 세계적으로 미세먼지(particulate matter, PM)와 사망률 및 유병률 증가의 관련성이 보고되면서 다양한 연구가 수행되었으며, 우리나라에서는 1990년대 후반을 기점으로 PM에 대한 중요성을 인식하고, PM에 대한 다양한 연구가 수행되었다. 본 연구에서는 '미세먼지' 관련 연구들의 주제를 분류하고, 각 주제별 연구 동향을 확인하기 위해 Research Information Sharing Service (RISS)에 게재된 미세먼지 관련 2,764편의 논문을 대상으로 Latent Dirichlet Allocate (LDA) 분석을 수행하였다. 연구 결과, 총 10개의 주제로 분류하는 것이 가장 적합하였으며, 미세먼지 관련 연구주제는 '미세먼지 저감(Topic 1)', '정부 정책 및 관리(Topic 2)', '미세먼지 특성(Topic 3)', '미세먼지 모델(Topic 4)', '환경교육(Topic 5)', '바이오(Topic 6)', '교통수단(Topic 7)', '황사(Topic 8)', '실내 미세먼지 오염(Topic 9)', '인체 위해성(Topic 10)'의 주제로 분류할 수 있었다. 특히, '정부 정책 및 관리(Topic 2)', '미세먼지 모델(Topic 4)', '환경교육(Topic 5)'. '바이오(Topic 6)' 관련 연구주제들이 시간에 따라 전체 논문에 대한 비율이 증가하는 추세를 보여 성행하는 것을 확인하였다(linear slope>0). 본 연구의 결과는 미세먼지 관련 다양한 분야의 연구자들에게 새로운 문헌 고찰의 방법론을 제시하고, 미세먼지 분야의 역사와 발전에 대한 이해를 제공했음에 의의가 있다.

LDA 모델을 이용한 잠재 키워드 추출 (Latent Keyphrase Extraction Using LDA Model)

  • 조태민;이지형
    • 한국지능시스템학회논문지
    • /
    • 제25권2호
    • /
    • pp.180-185
    • /
    • 2015
  • 인터넷 미디어의 발달과 함께 온라인 문서의 양이 급격하게 증가함에 따라, 문서 요약과 정보 검색 등 다양한 분야에 활용가능한 키워드를 자동으로 찾고자하는 연구가 활발히 진행되고 있다. 하지만 기존의 키워드 추출 연구들은 문서에서 나타나는 키워드만을 대상으로 하고 있어, 문서에서 등장하지 않는 잠재 키워드를 추출하지 못하는 한계를 갖고 있다. 잠재 키워드는 실데이터 키워드의 1/4 이상을 차지하고 있으며, 문서에서 나타나지는 않지만 문서의 중요한 개념이나 내용을 함축하고 있어 문서 요약 및 정보 검색에 중요한 역할을 차지할 수 있다. 특히 SNS와 같이 내용이 적어 키워드가 명시적으로 나타나기 어려운 문서에서 유용하게 활용될 수 있다. 본 논문에서는 잠재 키워드를 추출하기 위해 주어진 문서와 유사한 문서의 키워드를 후보 키워드로 선택하고 후보 키워드를 구성하는 개별 단어들을 이용해 후보 키워드의 중요도를 평가하는 방법을 제안한다. 실험을 통해, 제안 기법이 잠재 키워드를 합리적인 수준으로 추출할 수 있음을 보였다.

커뮤니티 기반 Q&A서비스에서의 질의 할당을 위한 이용자의 관심 토픽 분석에 관한 연구 (A Study on Mapping Users' Topic Interest for Question Routing for Community-based Q&A Service)

  • 박종도
    • 정보관리학회지
    • /
    • 제32권3호
    • /
    • pp.397-412
    • /
    • 2015
  • 본 연구에서는 커뮤니티 기반 질의응답 서비스에서의 질의할당을 위하여, 해당 커뮤니티에 축적된 질의응답 데이터 세트를 이용하여 해당 카테고리내의 토픽을 분석하고 이를 바탕으로 해당 토픽에 관심을 가지는 이용자의 관심 토픽을 분석하고자 하였다. 특정 카테고리 내의 토픽을 분석하기 위해서 LDA기법을 사용하였고 이를 이용하여 이용자의 관심 토픽을 모델링하였다. 나아가, 커뮤니티에 새롭게 유입되는 질의에 대한 토픽을 분석한 후, 이를 바탕으로 해당 토픽에 대해 관심을 가지고 있는 이용자를 추천하기 위한 일련의 방법들을 실험하였다.