• Title/Summary/Keyword: Text mining analysis

검색결과 1,198건 처리시간 0.024초

위키피디아 기반의 3차원 텍스트 표현모델을 이용한 개념망 구축 기법 (Building Concept Networks using a Wikipedia-based 3-dimensional Text Representation Model)

  • 홍기주;김한준;이승연
    • 정보과학회 컴퓨팅의 실제 논문지
    • /
    • 제21권9호
    • /
    • pp.596-603
    • /
    • 2015
  • 개념망(Concept Network)은 시멘틱 검색, 개인화 검색, 추천, 텍스트마이닝 기법의 개선 등에 필수적인 지식베이스이다. 최근 효과적인 개념망 구축을 위해 온톨로지를 기반으로 하여 개념의 표현을 확장시키는 연구가 활발하다. 이에 본 논문은 World Knowledge로 평가받고 있는 위키피디아 데이터를 '개념' 집합의 원천으로 활용하여 3차원 텍스트 표현 모델 기반 개념망을 구축하는 기법을 제안한다. 사실상 개념들 간의 관계 정보는 시간의 흐름에 따라 변동하기 때문에, 텍스트 문서로부터 도출되는 '개념'은 Formal Concept Analysis 이론체계의 개념에 따르는 것이 바람직하다. 이를 위해 본 논문은 하나의 개념을 '단어'와 '문서' 간의 2차원 행렬로 표현하여 문서집합에 잠재된 개념간의 연관망을 보다 정확하게 생성하게 한다.

텍스트 마이닝과 소셜 네트워크 분석을 이용한 재난대응 용어분석 (Analyzing Disaster Response Terminologies by Text Mining and Social Network Analysis)

  • 강성경;유환;이영재
    • 경영정보학연구
    • /
    • 제18권1호
    • /
    • pp.141-155
    • /
    • 2016
  • 세월호 침몰사고, 판교 환풍구 붕괴사고 등 재난은 점차 복합적이고 대형화되고 있다. 따라서 이러한 재난에 신속히 대응하기 위한 기관들의 협업 또한 중요해지고 있다. 다수기관 간 협업과정에서는 다양한 용어를 바탕으로 의사소통이 이루어진다. 의사소통은 '용어'를 기반으로 하므로 '용어'에 대한 중요성 또한 간과할 수 없다. 따라서 본 연구에서는 재난현장에서 사용하는 용어를 선정하여 텍스트 마이닝 및 소셜 네트워크 분석(SNA: Social Network Analysis)을 이용해 어떤 용어가 대응과정에 있어 핵심적인 용어인지를 파악해보았다. 텍스트 마이닝의 TDM을 이용하여 역문헌 빈도수를 산출해 용어와 문서 간의 관계를 알아보고, SNA를 통해 노드(용어)와 노드 사이의 관계를 파악하였다. 용어분석의 결과 표현은 용어 간의 유기적인 관계를 시각화할 수 있는 마인드맵(Mind Map)을 이용하였다. 용어는 미국의 NIMS, EMR, 그리고 우리나라의 재난 및 안전관리 기본법을 토대로 온톨로지 개념에 따라 계층적(Class, Object, Instance)으로 분류하였으며. 신문기사와 사설, 정책보고서 등의 정부 간행물에서 선정하였다. 이러한 재난대응 핵심용어의 파악은 재난현장에서 사용하는 용어를 표준화하기 위한 기초자료로 활용할 수 있으며, 온톨로지 개념에 따라 용어들을 계층적으로 분류하였기 때문에 재난 대응에 대한 다양한 자료들을 축적하고 검색하는데 용어의 분류체계를 활용할 수 있다. 이 밖에 사고대응 시나리오 작성 시에도 핵심용어를 활용할 수 있을 것으로 판단된다.

텍스트마이닝 기법을 활용한 국내외 장소성 관련 연구동향 분석 (Analyzing the Study Trends of 'Sense of Place' Using Text Mining Techniques)

  • 이인아;김혜진
    • 한국비블리아학회지
    • /
    • 제30권2호
    • /
    • pp.189-209
    • /
    • 2019
  • 주경로 분석(Main Path Analysis, MPA)은 문헌의 인용정보를 기반으로 지식이 전달되는데 기여한 핵심 문헌을 추출하는 텍스트마이닝 기법 중 하나이다. 본 연구는 1990년부터 2018년까지 국내외에서 발행된 장소성 관련 논문의 인용정보와 초록을 토대로 주경로 분석과 단어동시출현빈도 연관어 네트워크 분석을 적용하여 연구동향을 파악하였다. 1990년부터 2018년까지 수집된 문헌을 5년씩 기간 구분하여 (마지막 기간은 3년) 각 기간 별로 국내외에서 장소성 관련 연구가 전반적으로 어떻게 진행되었는지 비교 분석하여 제시하였다. 주경로 분석 결과, 1990년부터 해외의 장소성 관련 연구는 개인 정체성, 공공 토지 관리, 환경 교육, 도시 개발 분야 순으로 진행되어 온 것으로 나타났다. 단어동시출현을 기반으로 한 연관어 네트워크를 통해서는 국내의 경우 도시 개발, 문화, 문학, 역사 등 다양한 차원에서 장소성이 논의되는 격변기를 겪는 것으로 해석할 수 있었다. 반면 국외에서는 건강, 정체성, 경관, 도시 개발 관련 논의가 90년대부터 꾸준히 이루어지고 있는 것으로 파악되었다. 본 연구는 장소성 연구동향을 기존의 특정 영역에 장소성 개념을 적용하여 분석하는 미시적 관점의 분석이 아닌 다양한 텍스트마이닝 기법을 적용하여 장소성을 주제로 삼고 있는 논문의 전반적인 흐름을 파악하는 통시적 접근의 방법을 제시하였다는 점에서 시사점을 지닌다.

소셜미디어 분석을 통한 전고체 배터리 감성분석과 이슈 탐색 (Sentiment Analysis and Issue Mining on All-Solid-State Battery Using Social Media Data)

  • 이지연;이병희
    • 한국콘텐츠학회논문지
    • /
    • 제22권10호
    • /
    • pp.11-21
    • /
    • 2022
  • 전고체 배터리는 차세대 배터리의 유력 후보 중 하나로 특히 미래 전기차 산업을 이끌 핵심 부품으로 주목받고 있다. 본 연구에서는 글로벌 소셜미디어인 레딧(Reddit)의 전고체 배터리 관련 댓글 10,280건을 분석하여 전고체 배터리와 관련된 정책 이슈 및 대중의 관심사를 파악한다. 수집된 글로벌 데이터에 빈도분석, 연관규칙분석, 토픽모델링 등 텍스트마이닝 기법과 감성분석을 적용하여 세계적 동향을 읽고, 이를 우리 정부의 전고체 배터리 발전전략과 비교 및 관련 국가R&D의 정책적 방향을 제시하고자 한다. 분석 결과, 2016년부터 2021년까지의 전고체 배터리 이슈에 대한 전반적인 감성은 긍정이 50.5%, 부정이 39.5%로 긍정인 것으로 나타났다. 또한 세부 감성을 분석한 결과, 대중들은 전고체 배터리에 대해 신뢰와 기대를 가지고 있음과 동시에 해결되지 않은 기술적 문제들에 대한 두려움과 우려의 감정이 공존함을 알 수 있었다. 본 연구에서는 전고체 배터리와 관련된 핵심 이슈 도출을 위한 텍스트마이닝 분석 방법을 적용하였고, 정부 정책 분석을 바탕으로 한 하향식 접근방법과 대중의 인식을 분석하는 상향식 접근방법을 수용하여, 보다 포괄적인 동향 분석 방법을 제시하였다.

빅데이터 기반의 정성 정보를 활용한 부도 예측 모형 구축 (Bankruptcy Prediction Modeling Using Qualitative Information Based on Big Data Analytics)

  • 조남옥;신경식
    • 지능정보연구
    • /
    • 제22권2호
    • /
    • pp.33-56
    • /
    • 2016
  • 대부분의 부도 예측에 관한 연구는 재무 변수를 중심으로 통계적 방법 또는 인공지능 기법을 적용하여 부도 예측 모형을 구축하였다. 그러나 재무비율과 같은 회계 정보를 이용한 부도 예측 모형은 재무 제표 결산 시점과 신용평가 시점 간 시차를 고려하지 않을 뿐만 아니라 해당 산업의 경제적 상황과 같은 외부 환경적인 요소를 반영하기 어렵다는 한계점이 존재하였다. 기업의 부도 여부를 예측하기 위해 정량 정보인 재무 변수만을 이용하는 것에 한계가 있음에도 불구하고 정성 정보를 부도 예측 모형에 반영한 연구는 아직 미흡한 실정이다. 본 연구에서는 재무 변수를 이용하는 기존 부도 예측 모형의 성과를 개선하기 위해 빅데이터 기반의 정성 정보를 추가적인 입력 변수로 활용하는 부도 예측 모형을 제안하였다. 제안 모형의 성과 향상은 정성 정보를 예측 모형에 통합시키기에 적합한 형태로 정보의 유형을 변환시킬 수 있는가에 따라 달려있다. 이에 본 연구에서는 정성 정보 처리를 위한 방법으로 빅데이터 분석 기법 중 하나인 텍스트 마이닝(Text Mining)을 활용하였다. 해당 산업과 관련된 경제 뉴스 데이터로부터 경제 상황에 대한 감성 정보를 추출하기 위해 도메인 중심의 감성 어휘 사전을 구축하고, 구축된 어휘 사전을 기반으로 감성 분석(Sentiment Analysis)을 수행하였다. 형태소 분석 등을 포함한 텍스트 전처리 과정을 거쳐 감성 어휘를 추출하고, 각 어휘에 대한 극성 및 감성 점수를 부여하였다. 분석 결과, 전통적 부도 예측 모형에 경제 뉴스 데이터에서 도출한 정성 정보를 반영하는 것은 모형의 성과를 개선하는 것으로 나타났다. 특히, 경제 상황에 대한 부정적 감정이 기업의 부도 여부를 예측하는 데 더욱 효과적임을 알 수 있었다.

중고의류와 중고명품 구매 관련 언론 보도 빅데이터 분석: 텍스트마이닝을 활용한 사회적 인식과 현황 파악 (Big Data Analysis of News on Purchasing Second-hand Clothing and Second-hand Luxury Goods: Identification of Social Perception and Current Situation Using Text Mining)

  • 유화숙
    • Human Ecology Research
    • /
    • 제61권4호
    • /
    • pp.687-707
    • /
    • 2023
  • This study was conducted to obtain useful information on the development of the future second-hand fashion market by obtaining information on the current situation through unstructured text data distributed as news articles related to 'purchase of second-hand clothing' and 'purchase of second-hand luxury goods'. Text-based unstructured data was collected on a daily basis from Naver news from January 1st to December 31st, 2022, using 'purchase of second-hand clothing' and 'purchase of second-hand luxury goods' as collection keywords. This was analyzed using text mining, and the results are as follows. First, looking at the frequency, the collection data related to the purchase of second-hand luxury goods almost quadrupled compared to the data related to the purchase of second-hand clothing, indicating that the purchase of second-hand luxury goods is receiving more social attention. Second, there were common words between the data obtained by the two collection keywords, but they had different words. Regarding second-hand clothing, words related to donations, sharing, and compensation sales were mainly mentioned, indicating that the purchase of second-hand clothing tends to be recognized as an eco-friendly transaction. In second-hand luxury goods, resale and genuine controversy related to the transaction of second-hand luxury goods, second-hand trading platforms, and luxury brands were frequently mentioned. Third, as a result of clustering, data related to the purchase of second-hand clothing were divided into five groups, and data related to the purchase of second-hand luxury goods were divided into six groups.

'미술'과 '언어' 활동 융합형의 아동 발달지원 교육 프레임워크 개발을 위한 탐색적 연구: 텍스트 마이닝을 중심으로 (An exploratory study for the development of a education framework for supporting children's development in the convergence of "art activity" and "language activity": Focused on Text mining method)

  • 박윤미;김시정
    • 한국융합학회논문지
    • /
    • 제12권3호
    • /
    • pp.297-304
    • /
    • 2021
  • 이 연구는 학령기 아동의 발달지원을 위하여 기존의 미술 치료 및 교육에서 시행되어 온 시각적 사고 중심의 접근에 더하여, 언어 교육 및 치료적 접근을 융합하고자 한 것이다. 이에 언어와 미술의 서로 다른 영역의 융합 가능 영역을 탐색하기 위하여 텍스트 마이닝 기법을 적용하였다. 이에 따라 이 연구는 기초 연구, 예비 DB구축, 텍스트 선별, DB 전 처리 및 확정, 불용어 처리, 텍스트 마이닝 분석 및 융합 가능 역 도출'의 절차에 따라 연구를 진행하였다. 연구 결과, 미술 치료 및 교육과 언어 치료 및 교육 분야에서 나타나는 문헌상의 각 군집을 연계하여 의사소통 및 학습 기능, 문제해결 및 감각 기관, 예술 및 지능, 정보와 의사소통, 가정 및 장애, 주제와 개념화 및 또래, 통합과 재구성 및 태도 등과 관련된 융합역을 도출할 수 있었다. 결론적으로 본 연구를 통하여 향후 미술과 언어의 활동 중심 융합형 프로그램을 설계할 수 있는 프레임워크를 마련하고 아동발달 지원을 위한 총체적 접근을 시도하였다는 점에서 연구의 의의가 있다.

Identifying Mobile Owner based on Authorship Attribution using WhatsApp Conversation

  • Almezaini, Badr Mohammd;Khan, Muhammad Asif
    • International Journal of Computer Science & Network Security
    • /
    • 제21권7호
    • /
    • pp.317-323
    • /
    • 2021
  • Social media is increasingly becoming a part of our daily life for communicating each other. There are various tools and applications for communication and therefore, identity theft is a common issue among users of such application. A new style of identity theft occurs when cybercriminals break into WhatsApp account, pretend as real friends and demand money or blackmail emotionally. In order to prevent from such issues, data mining can be used for text classification (TC) in analysis authorship attribution (AA) to recognize original sender of the message. Arabic is one of the most spoken languages around the world with different variants. In this research, we built a machine learning model for mining and analyzing the Arabic messages to identify the author of the messages in Saudi dialect. Many points would be addressed regarding authorship attribution mining and analysis: collect Arabic messages in the Saudi dialect, filtration of the messages' tokens. The classification would use a cross-validation technique and different machine-learning algorithms (Naïve Baye, Support Vector Machine). Results of average accuracy for Naïve Baye and Support Vector Machine have been presented and suggestions for future work have been presented.

한국농수산대학 졸업생 영농정착 성공 사례집의 Text Mining - 주요단어의 빈도 분석 및 word cloud - (Text Mining of Successful Casebook of Agricultural Settlement in Graduates of Korea National College of Agriculture and Fisheries - Frequency Analysis and Word Cloud of Key Words -)

  • 주진수;김종숙;박석영;송천영
    • 현장농수산연구지
    • /
    • 제20권2호
    • /
    • pp.57-72
    • /
    • 2018
  • 본 연구는 한농대에서 발간하는 청년 농어업인들의 우수한 영어·영농 정착사례에서 의미 있는 정보를 추출하고자 프로그램 R의 Text mining으로 주요단어를 추출하고 시각화를 위하여 word cloud를 작성하였다. 먼저 전체 표본에 대한 text mining 결과에서는 '대표', '이사', '생각', '자신', '시작', '마음', '노력' 등이 상위 50개 핵심 단어 가운데 빈도수가 높게 나타난 단어들이다. 이는 젊은 농부들이 회사의 경영주가 되기 위해서거나 또는 경영주로서 그들 스스로 생각하고 판단하고 추진하는 능력을 갖추고 있음을 표현이며 자기의 꿈을 버리지 않고 스스로 꿈꾸는 일을 헤쳐 나가는 모습의 표현이라 할 수 있다. '아버지', '부친' 및 '부모님' 등의 단어 빈도수가 높은 것은 부모협농과 승계농의 비율이 높은 경영형태의 영향이라 할 수 있으며, '한국농수산대학', '대학', '졸업', '공부' 등의 단어는 이들의 높은 교육의식을 나타낸 결과이며, '유기농'과 '친환경' 의 단어는 우수사례자들의 친환경 농업에 대한 관심도를 나타낸 결과라 할 수 있다. 또한 '판매', '체험' 등의 6차산업 관련어는 농어업·농어촌을 활성화시키기 위한 이들의 노력을 나타내는 결과라 할 수 있다. 한편 '인터넷', '블로그', '온라인', '홈페이지', 'SNS', 'ICT', '융복합' 및 '스마트' 등의 단어들은 비록 상위 50위 안에는 없었으나 이들 단어들이 빠지지 않고 추출된 결과는 영어·영농의 과학화·첨단화에 청년농부들의 관심이 높아지고 있음을 알 수 있었다. 다음으로 품목별 샘플에 대하여 빈도수가 상위 50위 이내인 주요단어를 그룹화 한 결과로서 축산, 채소 및 수산은 '시설', 식량작물은 '장비', '기계' 등의 빈도수가 높게 나타냈다. '친환경'은 채소작물과 식량작물에서 나타났으며, '유기농'은 채소, 식량작물, 과수에서 나타났다. 식량작물에서는 '우렁이'가 추출되었으며, 우수농수산물을 의미하는 '인증'은 수산에서만 나타났다. '6차산업' 관련단어로 '생산'은 모든 계열, '가공', '유통'은 과수, '체험'은 채소, 식량작물 및 과수에서 나타났다. 그리고 텍스트 마이닝으로 추출한 단어를 시각화하기 위하여 전체 샘플과 각 품목별로 word cloud를 작성하여 구조화되지 않은 비정형 텍스트인 우수사례들이 내포하고 있는 의미를 글자의 크기로 알 수 있도록 나타냈다.

Topics and Sentiment Analysis Based on Reviews of Omni-Channel Retailing

  • KIM, Soon-Hong;YOO, Byong-Kook
    • 유통과학연구
    • /
    • 제19권4호
    • /
    • pp.25-35
    • /
    • 2021
  • Purpose: This study aims to analyze the factors affecting customer satisfaction in the customer reviews of omni-channel, posted on Internet blogs, cafes, and YouTube using text mining analysis. Research, data, and Methodology: In this study, frequency analysis is performed and the LDA (Latent Dirichlet Allocation) is used to analyze social big data to respond to reviewers' reaction to the recently opened omni-channel shopping reviews by L Shopping Company. Additionally, based on the topic analysis, we conduct a sentiment analysis on purchase reviews and analyze the characteristics of each topic on the positive or negative sentiments of omni-channel app users. Results: As a result of a topic analysis, four main topics are derived: delivery and events, economic value, recommendations and convenience, and product quality and brand awareness. The emotional analysis reveals that the reviewers have many positive evaluations for price policy and product promotion, but negative evaluations for app use, delivery, and product quality. Conclusions: Retailers can establish customized marketing strategies by identifying the customer's major interests through text mining analysis. Additionally, the analysis of sentiment by subject becomes an important indicator for developing products and services that customers want by identifying areas that satisfy customers and areas that evoke negative reactions.