• 제목/요약/키워드: 텍스트 수집

검색결과 697건 처리시간 0.03초

파이썬을 이용한 프레임내 웹 페이지 스크래핑 기법 (A Scraping Method of In-Frame Web Sources Using Python)

  • 윤수진;승리;우영운
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2019년도 춘계학술대회
    • /
    • pp.271-274
    • /
    • 2019
  • 이 논문에서는 일반적인 웹 접근 방법으로 접근하기 어려운 프레임 내 웹 페이지의 데이터를 프로그램에 의해 자동으로 수집하기 위한 세부 주소 확보 기법을 제안하였다. 제안한 세부 주소 확보 기법과 HTML 실렉터를 활용할 수 있는 Python 언어와 Beautiful Soup 라이브러리를 이용하여 여러 페이지로 작성되어 있는 게시판 텍스트 데이터를 자동으로 모두 수집할 수 있었다. 제안한 기법을 활용하여 어떠한 형태의 주소 형식으로 되어 있는 웹 페이지들에 대해서도 Python 웹스크래핑 프로그램에 의해 자동으로 대량의 데이터를 수집할 수 있으며, 이를 통해 빅데이터 분석에 활용될 수 있을 것으로 예상한다.

  • PDF

빅데이터를 활용한 공원 이용행태의 시계열분석 - 올림픽공원을 대상으로 - (Time Series Analysis of Park Use Behavior Utilizing Big Data - Targeting Olympic Park -)

  • 우경숙;서주환
    • 한국조경학회지
    • /
    • 제46권2호
    • /
    • pp.27-36
    • /
    • 2018
  • 본 연구는 공원 이용자의 욕구를 파악하여 이용자에 적합한 공원 환경으로 변화되어야 할 필요성에 주목하고, 이용자의 욕구를 파악하기 위하여 행태분석의 필요성을 제기하였다. 이에 온라인 데이터(블로그)를 연구의 기초자료로 선정하고, 5년 단위로 구분하여 데이터를 수집한 후 텍스트 마이닝을 활용해 시계열적 행태의 특성을 도출하고, 사회연결망 분석을 통해 온라인 데이터의 유의성을 검증하였다. 텍스트 마이닝 분석 결과, 첫째, '길을 걷다'(산책), '사진을 찍다', '자전거(인라인, 킥보드 등)를 타다', '먹다', '공연을 관람하다'는 올림픽공원에서 행해지는 공통적인 행태로 나타났다. 둘째, 수집된 데이터의 초기에는 운동 등 적극적인 신체활동을 행태가 주를 이루었지만, 최근에는 핸드폰, 게임, 음식을 먹고 커피를 마시는 등의 소극적인 비활동적 행태도 공원에서 나타나는 새로운 행태적 특징으로 나타났다. 셋째, 공원 이용자의 행태에 영향을 미치는 요인은 인터넷 발달, 자신의 개성과 스타일을 표현하는 문화 등 사회의 여러 가지 여건의 변화로 나타났다. 넷째, 올림픽공원에서 나타나는 특별한 행태는 공연 관람 등 문화적인 활동과 역사수업 등 교육적인 활동으로 도출되었다. 결론적으로 공원 계획 설계 시 의도하였던 목적보다는 여러 가지 시대적 변화로 사람들의 라이프 스타일이 변화하고, 공원의 행태에까지 영향을 미치는 것으로 나타났다. 이에 올림픽공원의 주요 행태와 영향을 미치는 요인을 고려하여 이용자에게 적합한 환경으로 변화되어야 할 필요성이 있다. 분석방법으로 활용한 텍스트 마이닝은 과거의 데이터도 수집이 가능하다는 장점이 있어 행태 분석 시 장기적인 관점에서 분석이 가능하고, 도출된 키워드로 새로운 행태 및 가치 측정이 가능하여 이후 행태분석 연구의 영역의 확대가 가능한 것으로 판단된다. 또한, 사회연결망 분석을 통해 온라인 데이터의 타당성을 검증하여 연구결과의 신뢰를 높일 수 있었다. 추후 수집하는 데이터의 종류를 다양하게 하여 더 포괄적인 행태분석에 대한 연구가 수행되어야 하며, 대용량 데이터의 정확성, 신뢰성을 검증할 수 있는 다양한 방법에 대한 연구가 필요할 것이다.

NLP기반 NER을 이용해 소셜 네트워크의 조직 구조 탐색을 위한 협력 프레임 워크 (A Collaborative Framework for Discovering the Organizational Structure of Social Networks Using NER Based on NLP)

  • 프랭크 엘리호데;양현호;이재완
    • 인터넷정보학회논문지
    • /
    • 제13권2호
    • /
    • pp.99-108
    • /
    • 2012
  • 방대한 양의 데이터로부터 정보추출의 정확도를 향상시키기 위한 많은 방법이 개발되어 왔다. 본 논문에서는NER(named entity recognition), 문장 추출, 스피치 태깅과 같은 여러 가지의 자연어 처리 작업을 통합하여 텍스트를 분석하였다. 데이터는 도메인에 특화된 데이터 추출 에이전트를 사용하여 웹에서 수집한 텍스트로 구성하였고, 위에서 언급한 자연어 처리 작업을 사용하여 비 구조화된 데이터로부터 정보를 추출하는 프레임 워크를 개발하였다. 조직 구조의 탐색을 위한 택스트 추출 및 분석 관점에서 연구의 성능을 시뮬레이션을 통해 분석하였으며, 시뮬레이션 결과, 정보추출에서 MUC 및 CoNLL과 같은 다른 NER 분석기 보다 성능이 우수함을 보였다.

인용 정보를 고려한 미발견 공공 지식 추출: Swanson의 ABC 모델 재현 및 확장 (Detection of Hidden Knowledge Using a Citation-Based Approach Based on Swanson's ABC Model)

  • 함정은;송민
    • 정보관리학회지
    • /
    • 제32권2호
    • /
    • pp.87-103
    • /
    • 2015
  • 많은 연구들 가운데 살펴볼 가치가 있는 대상을 찾아 제시해주는 문헌기반 발견의 접근법은 연구자들에게 매우 유용할 것이다. 문헌기반 발견 연구의 대표 이론인 Swanson의 ABC 모델은 기존에 검증되지 않은 개체들의 관계를 연구할 것을 제안해 준다. 본 연구는 Swanson의 ABC 모델에 인용 정보를 고려하여 유의한 관계에 있는 개체들을 더 효율적으로 찾아내고자 하였다. 수집 논문들의 참고문헌 목록에서 인용 정보를 확인하고 논문의 표제와 초록을 대상으로 텍스트 마이닝 기법으로 중요한 단어들을 추출하였다. Swanson의 연구들 중 어유와 레이노드 질병 및 증상의 관계를 재현하였으며 기존의 접근법으로 확인되는 개체들과 어떤 차이가 있는지 분석하였다.

신문기사 분석을 통한 이슈 라이프사이클에 관한 연구 - 삼성 갤럭시노트7 사례 - (A Study on the Issue Lifecycle through the Analysis of News Texts - A Case of Samsung Galaxy Note 7 -)

  • 허필희;김양석;이충권
    • 스마트미디어저널
    • /
    • 제7권4호
    • /
    • pp.99-105
    • /
    • 2018
  • 시장에 내놓은 제품이나 서비스가 문제를 일으켜서 해당 기업의 비즈니스와 이미지에 큰 타격을 입히는 사례가 자주 발생하고 있다. 발생한 문제에 적절하게 대응하고 피해를 최소화하는 것은 기업들에게 매우 중요한 일이다. 본 연구는 스마트폰 시장을 주도하고 있는 삼성이 개발하여 출시한 갤럭시노트7의 리콜 사태를 다루었던 뉴스를 수집하고 분석하였다. 이슈 라이프사이클에 기반하여 단계별로 뉴스의 특징을 표현하고 연관규칙을 이용하여 텍스트의 내용을 분석하고 시각화하였다. 본 연구의 결과는 이슈의 변화와 흐름을 이해하고 대응책을 모색해야 하는 기업들의 비즈니스 활동에 도움을 줄 것으로 기대된다.

텍스트마이닝을 활용한 Covid-19 기간 동안의 항공산업 관련 키워드 트렌드 분석 (Keyword trends analysis related to the aviation industry during the Covid-19 period using text mining)

  • 최동현;송보미;박다현;이성우
    • 한국산업정보학회논문지
    • /
    • 제27권2호
    • /
    • pp.115-128
    • /
    • 2022
  • 본 연구는 Covid-19 팬데믹이 항공산업에 미친 영향과 동향을 살펴보고자 국내 뉴스 기사 데이터를 활용하여 키워드 트렌드 분석을 진행하였다. 데이터 수집을 위하여 Covid-19 발생 기준으로 전, 후 각 6개월의 기간을 나누어 '항공사' 키워드를 중심으로 관련 기사들을 추출하였다. 이후 기간별 동시 출현 빈도를 파악한 후 LDA 기법을 이용하여 토픽 모델링을 진행하였으며, Covid-19의 진행 동향과 토픽 패턴과의 관계 분석을 통해 상황에 따른 주요 토픽을 도출하였다. 이러한 결과를 활용하여 Covid-19와 같이 범세계적으로 영향을 주는 전염병이 발생할 경우 그 추이에 따라 항공산업에 미치는 영향을 예측할 수 있는 기초자료로 활용될 수 있을 것으로 기대된다.

텍스트 마이닝을 활용한 웹툰 애플리케이션 사용자 리뷰 분석 (Analysis of User Reviews for Webtoon Applications Using Text Mining)

  • 신효림;최준호
    • 문화기술의 융합
    • /
    • 제8권4호
    • /
    • pp.457-468
    • /
    • 2022
  • 웹툰 산업이 급속도로 성장하며, 이러한 성장세와 함께 새로운 웹툰 애플리케이션 모델이 제시되었다. 웹툰 애플리케이션 1.0과 2.0을 지나 3.0의 시대가 시작된 것이다. 이러한 변화에도 불구하고 아직까지 웹툰 애플리케이션을 대상으로 한 사용자 리뷰 분석 연구는 부족한 실정이다. 이에 이 연구는 웹툰 애플리케이션 3.0 모델을 제시한 '카카오웹툰(다음웹툰)'을 대상으로 사용자 리뷰를 분석하고자 한다. 분석을 위해 애플리케이션 리뷰 20,382개를 수집한 후 전처리 과정을 버전 별로 TF-IDF, 네트워크 분석, 토픽 모델링, 감성 분석을 실시하였다. 이를 통해 웹툰 애플리케이션 변화에 따른 사용자 경험을 탐구하고 리뷰를 통한 사용성 평가를 진행하였다.

CNN-LSTM 모델 기반의 감성분석을 이용한 상품기획 모델 (Product Planning using Sentiment Analysis Technique Based on CNN-LSTM Model)

  • 김도연;정진영;박원철;박구락
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2021년도 제64차 하계학술대회논문집 29권2호
    • /
    • pp.427-428
    • /
    • 2021
  • 정보통신기술의 발달로 전자상거래의 증가와 소비자들의 제품에 대한 경험과 지식의 공유가 활발하게 진행됨에 따라 소비자는 제품을 구매하기 위한 자료수집, 활용을 진행하고 있다. 따라서 기업은 다양한 기능들을 반영한 제품이 치열하게 경쟁하고 있는 현 시장에서 우위를 점하고자 소비자 리뷰를 분석하여 소비자의 정확한 소비자의 요구사항을 분석하여 제품기획 프로세스에 반영하고자 텍스트마이닝(Text Mining) 기술과 딥러닝(Deep Learning) 기술을 통한 연구가 이루어지고 있다. 본 논문의 기초자료가 되는 데이터셋은 포털사이트의 구매사이트와 오픈마켓 사이트의 소비자 리뷰를 웹크롤링하고 자연어처리하여 진행한다. 감성분석은 딥러닝기술 중 CNN(Convolutional Neural Network), LSTM(Long Short Term Memory) 조합의 모델을 구현한다. 이는 딥러닝을 이용한 제품기획 프로세스로 소비자 요구사항 반영, 경제적인 측면, 제품기획 시간단축 등 긍정적인 영향을 미칠 것으로 기대한다.

  • PDF

분야연상어의 수집과 추출 알고리즘 (Collection and Extraction Algorithm of Field-Associated Terms)

  • 이상곤;이완권
    • 정보처리학회논문지B
    • /
    • 제10B권3호
    • /
    • pp.347-358
    • /
    • 2003
  • 인간은 문서전체를 읽지 않고 대표적인 단어를 보는 것만으로 정치나 스포츠 등의 분야를 정확히 인지할 수 있다. 문서전체를 대상으로 하지 않고 부분텍스트에서 출현하는 소수의 단어정보에서 문서의 분야를 정확히 결정하기 위해 분야연상어의 구축은 중요한 연구과제이다. 인간이 미리 분야체계를 정의하고, 각 분야에 해당하는 문서를 인터넷이나 서적을 통해 수집한다. 본 논문은 수집문서의 분야를 정확히 지시하는 분야연상어를 수집하는 방법을 제안한다. 문서의 분야결정 시점을 고려하여 분야연상어의 수준과 안정성 랭크에 대하여 논의한다. 학습데이터에서 분야연상어 후보의 각 수준을 자동으로 결정하고, 컴퓨터가 제시하는 분야연상어의 수준, 안정성 랭크, 집중률, 빈도정보를 이용하여 단일 분야연상어를 수집하는 방법을 제안한다.

텍스트마이닝을 이용한 윤동주 연구의 개체계량학적 분석 (Entitymetrics Analysis of the Research Works of Dong-ju Yun using Textmining)

  • 박진균;김택윤;송민
    • 한국비블리아학회지
    • /
    • 제28권1호
    • /
    • pp.191-207
    • /
    • 2017
  • 이 연구는 텍스트마이닝 기술을 이용한 개체계량학적 분석을 인문학 분야 인물 연구에 적용하기 위해 수행하였다. 연구 대상으로 한 인물은 작품뿐만 아니라 종교, 생애에 대해 많은 연구가 이루어진 윤동주를 선정하였다. 본 논문에서는 윤동주 관련 연구 1,076건을 수집하여 이중에서 초록 정보를 가지고 있었던 220건의 논문을 대상으로 LDA(Latent Dirichlet Allocation) 방식의 토픽모델링 분석을 수행하였으며, 참고문헌 정보를 추출할 수 있었던 121건의 논문을 대상으로 저자동시인용 분석을 통해 연구의 동향을 살펴보았다. 또한 초록에서 인명, 작품명의 개체를 추출하여 이들의 관계를 살펴보았다. 이 연구를 통해 윤동주에 관련한 연구 동향은 생애, 시, 실존의식, 비교문학, 번역문학, 종교적 신념에 대한 연구로 다양한 분야에 걸쳐 이루어졌다는 것을 데이터를 기반으로 보다 객관적으로 분석해 볼 수 있었으며, 윤동주와 함께 연구되는 다른 인물이 어떤 작품을 매개로 하여 연구되어 왔는지에 대해서도 알 수 있었다. 이러한 결과는 인문학 분야의 지적구조를 밝히는데 개체계량학적 방법이 유용함을 증명하는 한편 인문학연구의 새로운 시각적 접근을 제안했다는 데에 의의가 있다.