• 제목/요약/키워드: Latent semantic analysis

검색결과 65건 처리시간 0.023초

의무 기록 문서 분류를 위한 자연어 처리에서 최적의 벡터화 방법에 대한 비교 분석 (Comparative Analysis of Vectorization Techniques in Electronic Medical Records Classification)

  • 유성림
    • 대한의용생체공학회:의공학회지
    • /
    • 제43권2호
    • /
    • pp.109-115
    • /
    • 2022
  • Purpose: Medical records classification using vectorization techniques plays an important role in natural language processing. The purpose of this study was to investigate proper vectorization techniques for electronic medical records classification. Material and methods: 403 electronic medical documents were extracted retrospectively and classified using the cosine similarity calculated by Scikit-learn (Python module for machine learning) in Jupyter Notebook. Vectors for medical documents were produced by three different vectorization techniques (TF-IDF, latent sematic analysis and Word2Vec) and the classification precisions for three vectorization techniques were evaluated. The Kruskal-Wallis test was used to determine if there was a significant difference among three vectorization techniques. Results: 403 medical documents were relevant to 41 different diseases and the average number of documents per diagnosis was 9.83 (standard deviation=3.46). The classification precisions for three vectorization techniques were 0.78 (TF-IDF), 0.87 (LSA) and 0.79 (Word2Vec). There was a statistically significant difference among three vectorization techniques. Conclusions: The results suggest that removing irrelevant information (LSA) is more efficient vectorization technique than modifying weights of vectorization models (TF-IDF, Word2Vec) for medical documents classification.

텍스트마이닝과 ChatGPT 분석을 활용한 기업과 대중의 ESG 인식 비교: 지속가능경영보고서와 소셜미디어를 기반으로 (Comparing Corporate and Public ESG Perceptions Using Text Mining and ChatGPT Analysis: Based on Sustainability Reports and Social Media)

  • 최재훈;양성병;윤상혁
    • 지능정보연구
    • /
    • 제29권4호
    • /
    • pp.347-373
    • /
    • 2023
  • 최근 기업의 지속가능한 성장을 이끄는 ESG(Environmental, Social, and Governance) 관리의 중요성이 강조되고 있다. 이에, 본 연구는 기업과 일반 대중 간의 ESG에 대한 인식 차이를 실증적으로 밝히고, ESG 정책의 시행을 방해하는 부정적인 여론과 그 배경을 규명하는 것을 목표로 한다. 이를 위해, LDA(Latent Dirichlet Allocation) 토픽모델링, JST(Joint Sentiment Topic Modeling) 및 의미연결망분석 기법을 사용하여 지속가능경영보고서와 소셜미디어에서의 주요 키워드와 토픽, 그리고 그 연결관계를 분석하였다. 또한, ChatGPT를 활용하여, 텍스트마이닝 분석의 결과를 보완하였다. 분석 결과, 기업과 일반 대중 간 ESG에 대한 인식과 중요도에 상당한 차이가 있음을 확인하였다. 구체적으로, 기업들은 위기 관리, 투명한 지배구조, 윤리적 경영 등에 집중하여 신뢰를 구축하려 했으나, '그린워싱', '중대재해', '불매운동' 등과 같은 부정적 키워드가 자주 소셜네트워크에서 등장하여, 많은 대중들이 기업의 ESG 이슈 처리에 대해 의심하고 있음을 확인하였다. 본 연구는 기업, 정부 기관, 고객 및 투자자를 위한 ESG 전략수립에 도움이 될 수 있는 가이드라인을 제공한다는 점에서 의의가 있다.

LSA를 이용한 정형·비정형데이터 분석과 범죄 프로파일링 시스템 구현 (Analysis of Structured and Unstructured Data and Construction of Criminal Profiling System using LSA)

  • 김용훈;정목동
    • 한국멀티미디어학회논문지
    • /
    • 제20권1호
    • /
    • pp.66-73
    • /
    • 2017
  • Due to the recent rapid changes in society and wide spread of information devices, diverse digital information is utilized in a variety of economic and social analysis. Information related to the crime statistics by type of crime has been used as a major factor in crime. However, statistical analysis using only the structured data has the difficulty in the investigation by providing limited information to investigators and users. In this paper, structured data and unstructured data are analyzed by applying Korean Natural Language Processing (Ko-NLP) and the Latent Semantic Analysis (LSA) technique. It will provide a crime profile optimum system that can be applied to the crime profiling system or statistical analysis.

LSA모형에서 다의어 의미의 표상 (Representation of ambiguous word in Latent Semantic Analysis)

  • 이태헌;김청택
    • 인지과학
    • /
    • 제15권2호
    • /
    • pp.23-31
    • /
    • 2004
  • 잠재의미분석은 단어 의미를 동일한 맥락 (문장/문서) 하에서 동시에 제시되는 단어들의 공기성(co-occurence)으로 정의한다. 이 분석에서 한 단어는 맥락들을 대표하는 측들로 구성된 다차원 상의 한 점으로 표상 되며, 단어 의미는 각 단어가 맥락 속에서 등장한 빈도로 정의된다. 이 다차원 의미공간은 SVD를 통하여 차원이 축소되어 추상된 의미를 표상 한다. 이 연구는 다의어의 표상이 가능하도록 LSA를 발전시켰다. 제안된 LSA는 축에 대한 해석이 가능하도록 축의 회전을 도입하였으며 다의어 표상을 가능하게 하였다. 시뮬레이션에서는, 먼저 LSA에 의해 산출된 단어-맥락 빈도표에서 다의어를 포함하고 있는 문서들만을 재 수집한 다음 문서들을 다의어 의미별로 분류하였다. 두 번째 단계에서는 다의어의 특정의미에 대한 표상을 분류된 단어-맥락 빈도표에서 비해당 의미에 대한 맥락들을 제거한 후 LSA를 적용하여 구성하였다. 시뮬레이션 결과는 다의어의 의미들을 LSA가 표상 할 수 있음을 보여주었다. 이는 축회전을 포함한 LSA가 다의어 다중의미를 표상 할 수 있고 실용적인 측면에서 웹검색 엔진에도 적용될 수 있음을 시사한다.

  • PDF

선택적 자질 차원 축소를 이용한 최적의 지도적 LSA 방법 (Optimal supervised LSA method using selective feature dimension reduction)

  • 김정호;김명규;차명훈;인주호;채수환
    • 감성과학
    • /
    • 제13권1호
    • /
    • pp.47-60
    • /
    • 2010
  • 기존 웹 페이지 자동분류 연구는 일반적으로 학습 기반인 kNN(k-Nearest Neighbor), SVM(Support Vector Machine)과 통계 기반인 Bayesian classifier, NNA(Neural Network Algorithm)등 여러 종류의 분류작업에서 입증된 분류 기법을 사용하여 웹 페이지를 분류하였다. 하지만 인터넷 상의 방대한 양의 웹 페이지와 각 페이지로부터 나오는 많은 양의 자질들을 처리하기에는 공간적, 시간적 문제에 직면하게 된다. 그리고 분류 대상을 표현하기 위해 흔히 사용하는 단일(uni-gram) 자질 기반에서는 자질들 간의 관계 분석을 통해 자질에 정확한 의미를 부여하기 힘들다. 특히 본 논문의 분류 대상인 한글 웹 페이지의 자질인 한글 단어는 중의적인 의미를 가지는 경우가 많기 때문에 이러한 중의성이 분류 작업에 많은 영향을 미칠 수 있다. 잠재적 의미 분석 LSA(Latent Semantic Analysis) 분류기법은 선형 기법인 특이치 분해 SVD(Singular Value Decomposition)을 통해 행렬의 분해 및 차원 축소(dimension reduction)를 수행하여 대용량 데이터 집합의 분류를 효율적으로 수행하고, 또한 차원 축소를 통해 새로운 의미공간을 생성하여 자질들의 중의적 의미를 분석할 수 있으며 이 새로운 의미공간상에 분류 대상을 표현함으로써 분류 대상의 잠재적 의미를 분석할 수 있다. 하지만 LSA의 차원 축소는 전체 데이터의 표현 정도만을 고려할 뿐 분류하고자 하는 범주를 고려하지 않으며 또한 서로 다른 범주 간의 차별성을 고려하지 않기 때문에 축소된 차원 상에서 분류 시 서로 다른 범주 데이터간의 모호한 경계로 인해 안정된 분류 성능을 나타내지 못한다. 이에 본 논문은 새로운 의미공간(semantic space) 상에서 서로 다른 범주사이의 명확한 구분을 위한 특별한 차원 선택을 수행하여 최적의 차원 선택과 안정된 분류성능을 보이는 최적의 지도적 LSA을 소개한다. 제안한 지도적 LSA 방법은 기본 LSA 및 다른 지도적 LSA 방법들에 비해 저 차원 상에서 안정되고 더 높은 성능을 보였다. 또한 추가로 자질 생성 및 선택 시 불용어의 제거와 자질에 대한 가중치를 통계적인 학습을 통해 얻음으로써 더 높은 학습효과를 유도하였다.

  • PDF

용어 연관성 분석을 이용한 사용자 위주의 문서순위결정 기법 (User-Centered Document Ranking Technique using Term Association Analysis)

  • 우선미;유춘식;김용성
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제28권2호
    • /
    • pp.149-156
    • /
    • 2001
  • 정보의 가치와 사용자의 정보획득 요구가 증대됨에 따라 특정 개인 위주의 서비스를 제공하는 정보검색 시스템의 필요성이 증대되고 있다. 그러나 현재의 정보검색 시스템들은 사용자의 선호도를 반영하고 편의성을 제공하는 면에서 매우 미흡한 점들이 많다. 따라서 본 논문에서는 적합성 정도에 따라 최적의 문서를 제공하기 위하여 사용자 위주의 문서순위결정 기법을 제안한다. 특정 개인의 선호도(preference)를 반영하기 위하여 사용자 프로파일(User Profile)을 구성 및 갱신하고, LSA(Latent Semantic Analysis)를 적용하여 적합율에 따라 문서의 순위를 결정한다.

  • PDF

음악감상에서의 음질 평가를 위한 한국어 어휘의 의미론적 속성 분석 (Analysis of Semantic Attributes of Korean Words for Sound Quality Evaluation in Music Listening)

  • 이은영;유가을;이영미
    • 인간행동과 음악연구
    • /
    • 제21권2호
    • /
    • pp.107-134
    • /
    • 2024
  • 본 연구는 음악감상 시 지각하는 음질(sound quality)을 평가할 때, 어휘를 통한 평가가 음악 유형에 따라 달라지는지 분석하여, 음질 평가 어휘의 의미론적 속성에 대한 기초 자료를 제공하고자 하였다. 평균 9.4년의 전문 훈련을 받은 20-30대의 음악 전공자 31명이 참여하였고, 각 참여자는 성부수와 악기의 소리 산출 방식(악기군)에 따라 구성된 9개 음악을 듣고 음질을 나타내는 18개 의미단어 쌍을 평가하였다. 요인 분석을 통해 동일 요인에 영향을 받는 단어들을 그룹화하였고, 다변량 분산 분석을 통해 각 요인 그룹별로 성부 수와 악기군에 따른 차이를 확인하였다. 또한, 유의한 차이를 보이는 의미 단어 세트를 사용해 레이더 차트를 그려 각 음악별 차이를 시각적으로 분석하였다. 연구 결과, 4개 요인이 추출되었으며, '부드러운-딱딱한', '둔한-날카로운', '지저분한-정돈된', '낮은- 높은'의 단어 쌍이 음악 유형에 따라 유의한 차이를 보였다. 이 4개 단어 쌍을 바탕으로 작성된 레이더 차트는 각 음악에 대한 음질 평가를 구분하는 데 효과적이었다. 이 결과는 한국어 기반 음질평가 어휘 개발 시, 국외 연구에서 보고된 범주와는 다른 구조의 체계가 필요하며, 언어적·문화적 요인의 반영이 중요함을 시사한다. 또한, 교차 감각 대응(cross-modal correspondence)에 기반한 어휘 범주 중에서도 음향적 속성에 민감한 범주가 존재함을 확인하였다. 본 연구는 언어적·문화적 속성과 더불어 음질에 영향을 미치는 음악 요인을 반영할 수 있는 음질 평가 어휘 개발에 필요한 기술자료를 제공할 것으로 기대된다.

TLS 마이닝을 이용한 '정보시스템연구' 동향 분석 (Analysis on the Trend of The Journal of Information Systems Using TLS Mining)

  • 윤지혜;오창규;이종화
    • 한국정보시스템학회지:정보시스템연구
    • /
    • 제31권1호
    • /
    • pp.289-304
    • /
    • 2022
  • Purpose The development of the network and mobile industries has induced companies to invest in information systems, leading a new industrial revolution. The Journal of Information Systems, which developed the information system field into a theoretical and practical study in the 1990s, retains a 30-year history of information systems. This study aims to identify academic values and research trends of JIS by analyzing the trends. Design/methodology/approach This study aims to analyze the trend of JIS by compounding various methods, named as TLS mining analysis. TLS mining analysis consists of a series of analysis including Term Frequency-Inverse Document Frequency (TF-IDF) weight model, Latent Dirichlet Allocation (LDA) topic modeling, and a text mining with Semantic Network Analysis. Firstly, keywords are extracted from the research data using the TF-IDF weight model, and after that, topic modeling is performed using the Latent Dirichlet Allocation (LDA) algorithm to identify issue keywords. Findings The current study used the summery service of the published research paper provided by Korea Citation Index to analyze JIS. 714 papers that were published from 2002 to 2012 were divided into two periods: 2002-2011 and 2012-2021. In the first period (2002-2011), the research trend in the information system field had focused on E-business strategies as most of the companies adopted online business models. In the second period (2012-2021), data-based information technology and new industrial revolution technologies such as artificial intelligence, SNS, and mobile had been the main research issues in the information system field. In addition, keywords for improving the JIS citation index were presented.

공원 이슈에 대한 주요 언론의 담론변화분석 - 1995년부터 2019년까지 신문 기사를 중심으로 - (Analysis of Changes in Discourse of Major Media on Park Issues - Focusing on Newspaper Articles Published from 1995 to 2019 -)

  • 고하정
    • 한국조경학회지
    • /
    • 제49권5호
    • /
    • pp.46-58
    • /
    • 2021
  • 국내에 근대식 공원이 도입된 이후, 공원은 우리에게 필수적인 존재가 되었다. 민선시기 이후, 공원조성 등 공원을 둘러싼 이슈가 생산되고 언론을 통해 확산되어 담론을 형성하는 과정을 거쳤다. 이에 본 연구는 민선시장 체제인 1995년 이후의 '공원' 관련 이슈를 다룬 국내 중앙지의 보도기사를 수집하여 토픽분석과 의미연결망 분석을 통해 공원에 대한 시계열적 담론 변화 추이를 분석하였다. LDA 토픽모델링 분석결과, 5개의 토픽-도시공원확충(토픽1), 역사문화공원(토픽2), 이용프로그램(토픽3), 동물원 사건사고(토픽4), 공원조성과정갈등(토픽5)-으로 분류되었다. 언론에서 다룬 주요 공원담론은 다음과 같다. 첫째, 공원의 양적 확장에 대한 조성과정과 갈등이 주요 담론으로 다뤄지고 있다. 둘째, 신규 공원 조성시마다 공원명이 신규 단어로 출현하고 이후 지속적으로 언급되면서 담론형성에 한 축을 담당하고 있다. 셋째, 민선시대 공원 관련 언론에서 '주민'은 주요 주체로 '도시', '환경'과 함께 언급되며, 공원의 공공성에 대한 담론을 형성하고 있다. 본 연구는 공원이 언론을 통해 어떻게 해석되는지 담론변화를 살펴보았다는 점에서 의의를 가진다. 추후 본 연구에서 다룬 중앙지 외에 지역지, 전문지 등 다른 매체에 대한 연구를 통해 공원에 대한 다양한 관점의 담론이 다뤄지길 기대한다.

Patent Technology Trends of Oral Health: Application of Text Mining

  • Hee-Kyeong Bak;Yong-Hwan Kim;Han-Na Kim
    • 치위생과학회지
    • /
    • 제24권1호
    • /
    • pp.9-21
    • /
    • 2024
  • Background: The purpose of this study was to utilize text network analysis and topic modeling to identify interconnected relationships among keywords present in patent information related to oral health, and subsequently extract latent topics and visualize them. By examining key keywords and specific subjects, this study sought to comprehend the technological trends in oral health-related innovations. Furthermore, it aims to serve as foundational material, suggesting directions for technological advancement in dentistry and dental hygiene. Methods: The data utilized in this study consisted of information registered over a 20-year period until July 31st, 2023, obtained from the patent information retrieval service, KIPRIS. A total of 6,865 patent titles related to keywords, such as "dentistry," "teeth," and "oral health," were collected through the searches. The research tools included a custom-designed program coded specifically for the research objectives based on Python 3.10. This program was used for keyword frequency analysis, semantic network analysis, and implementation of Latent Dirichlet Allocation for topic modeling. Results: Upon analyzing the centrality of connections among the top 50 frequently occurring words, "method," "tooth," and "manufacturing" displayed the highest centrality, while "active ingredient" had the lowest. Regarding topic modeling outcomes, the "implant" topic constituted the largest share at 22.0%, while topics concerning "devices and materials for oral health" and "toothbrushes and oral care" exhibited the lowest proportions at 5.5% each. Conclusion: Technologies concerning methods and implants are continually being researched in patents related to oral health, while there is comparatively less technological development in devices and materials for oral health. This study is expected to be a valuable resource for uncovering potential themes from a large volume of patent titles and suggesting research directions.