• 제목/요약/키워드: 문서군집

검색결과 127건 처리시간 0.023초

주성분 자기조직화 지도 PC-SOM (Principal Components Self-Organizing Map PC-SOM)

  • 허명회
    • 응용통계연구
    • /
    • 제16권2호
    • /
    • pp.321-333
    • /
    • 2003
  • 자기조직화 지도(SOM)은 T. 코호넨의 주도하에 개발된 비지도 학습 신경망 모형이다. 그 동안 패턴인식과 문서검색 분야에 주로 응용되어 왔기 때문에 통계학 분야에서는 덜 알려졌으나, 최근 K-평균 군집화에 대한 대안적 데이터 마이닝 기법으로 활용되기 시작하였다. 본 연구에서는 SOM의 한 버전인 PC-SOM(주성분 자기조직화 지도)을 제안하고 활용 예를 제시하고자 한다. PC-SOM은 1차원적 SOM 알고리즘을 반복 수행하여 2차원, 3차원 등의 SOM을 얻는 방법이기 때문에 기존 SOM과는 달리 사전 Map의 크기를 확정할 필요가 없다. 또한, 기존 SOM에 비하여 향상된 시각화를 가능하게 한다.

협력적 여과와 내용 기반 여과의 병합을 통한 추천 시스템에서의 사용자 선호도 발견 (Discovery of User Preference in Recommendation System through Combining Collaborative Filtering and Content based Filtering)

  • 고수정;김진수;김태용;최준혁;이정현
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제7권6호
    • /
    • pp.684-695
    • /
    • 2001
  • 최근의 추천 시스템은 협력적 여과 시스템의 희박성과 초기 평가 문제를 해결하기 위하여 내용 기반 여과 시스템과 협력적 여과 시스템을 병합하는 방법을 사용한다. 협력적 여과 시스템은 부가적인 상품을 예측하기 위해 사용자의 선호도에 대한 데이타베이스를 사용한다. 내용 기반 여과 시스템은 상품의 속성과 사용자의 흥미를 대조함에 의해 아이템을 추천한다. 본 논문에서는 두 가지의 기술을 기계 학습 알고리즘에 응용하고 병합함으로써 사용자의 선호도를 발견하는 방법을 기술한다. 제안된 협력적 여과 방법에서는 유전자 알고리즘을 이용하여 Naive Bayes 분류자에 의해 분류된 아이템을 기반으로 사용자 군집을 생성하며 내용 여과 기법에서는 연관 피드백에 의해 사용자의 흥미를 추출함으로써 사용자의 프로파일을 생성한다. 제안된 방법은 웹문서에 대해 사용자가 평가한 데이타베이스에서 평가되며 기존의 방법보다 높은 성능을 나타냄을 보인다.

  • PDF

랜덤 포레스트를 이용한 한국어 상호참조 해결 (Coreference Resolution for Korean Using Random Forests)

  • 정석원;최맹식;김학수
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제5권11호
    • /
    • pp.535-540
    • /
    • 2016
  • 상호참조 해결은 문서 내에 존재하는 멘션들을 식별하고, 참조하는 멘션끼리 군집화하는 것으로 정보 추출, 사건 추적, 질의응답과 같은 자연어처리 응용에 필수적인 과정이다. 최근에는 기계학습에 기반한 다양한 상호참조 해결 모델들이 제안되었으며, 잘 알려진 것처럼 이런 기계학습 기반 모델들은 상호참조 멘션 태그들이 수동으로 부착된 대량의 학습 데이터를 필요로 한다. 그러나 한국어에서는 기계학습 모델들을 학습할 가용한 공개 데이터가 존재하지 않는다. 그러므로 본 논문에서는 다른 기계학습 모델보다 적은 학습 데이터를 필요로 하는 효율적인 상호참조 해결 모델을 제안한다. 제안 모델은 시브-가이드 자질 기반의 랜덤 포레스트를 사용하여 상호참조하는 멘션들을 구분한다. 야구 뉴스 기사를 이용한 실험에서 제안 모델은 다른 기계학습 모델보다 높은 0.6678의 CoNLL F1-점수를 보였다.

텍스트 마이닝을 이용한 스마트 도시계획 수립을 위한 전략분야 도출연구: 부산 사례를 바탕으로 (Identification of Strategic Fields for Developing Smart City in Busan Using Text Mining)

  • 채윤식;이상훈
    • 디지털융복합연구
    • /
    • 제16권11호
    • /
    • pp.1-15
    • /
    • 2018
  • 본 연구의 목적은 텍스트 마이닝 기법을 활용하여 부산 및 기타 지자체의 도시계획 보고서에 포함되어 있는 서지정보를 분석하고 새로운 스마트도시계획의 수립을 위한 전략 분야를 도출하는 것이다. 텍스트 마이닝 분석은 구조화되어 있지 않은 문서로부터 키워드를 추출하고 획득한 정보의 특성과 패턴을 발견하는 기법으로 최근 지식관리 측면에서 많이 사용되고 있다. 본 분석을 통해 초기의 부산 도시계획은 개별 산업분야 고도화에 초점이 맞춰져 있을 뿐 각 분야별 정보시스템의 연계에 대한 논의가 적은 것으로 나타났지만 최근 계획에서는 도시통합운영관리와 관련한 물리적 인프라와 ICT시스템과 관련한 내용이 다수 포함되어있는 것으로 나타났다. 특히, 타 지자체에 비해 항만/물류, 문화, 전시 분야가 특유의 서비스영역으로 도출되었지만 도시안전, 데이터공유, 신재생에너지 분야에 대한 계획은 부족한 것으로 나타났다. 본 연구는 향후 새로운 스마트 도시계획 수립을 위한 정책적 시사점을 제공할 것으로 기대한다.

시맨틱 네트워크를 통한 문학작품 속 인물과 의상의 관계 -소설 「노르웨이의 숲」- (The Relationship Between Character and Costume in literary Work using Semantic networks -The novel 「Norwegian Wood」-)

  • 최영현;김성은;이규혜
    • 디지털융복합연구
    • /
    • 제19권1호
    • /
    • pp.307-314
    • /
    • 2021
  • 본 연구에서는 시맨틱 네트워크의 원리를 장편소설에 적용하여, 문서 전체의 구조를 파악하고 단어와 단어 간의발현 관계를 알아보고자 했다. 무라카미 하루키의 소설 '노르웨이의 숲'을 분석 대상으로, 등장인물의 상징과 관계, 성격특성, 의상 표현을 네트워크 분석을 통해 분석했다. CNM 군집화 알고리즘을 통해 소설 속 등장인물들의 상징과 인물간의 관계 속성을 확인할 수 있었다. 이에 따라, 소설 속 등장인물의 관계와 인물이 상징하는 잠재적인 의미가 전체 네트워크 구조 내에서 서로 유사한 구조적 특성을 가지며 동일 집단에 나타나고 있음을 확인할 수 있었다. 작가가 의도한 세계관 내에서 만든 등장인물 간의 관계에 대한 묘사나 상징들을 파악할 수 있었다. 인물의 성격, 불안정한 정신상태, 심경 변화가 연결중심성이 높은 함축적인 몇 개의 단어를 통해 나타나고 있었다. 인물의 특성에 따른 의상 표현 역시 인물을 설명하는 단서로 적절하게 연결되는 것을 확인할 수 있었다. 본 연구는 융합연구로써, 문학작품을 대상으로 새로운 방법론을 제시했다는데 학술적 의의가 있다.

빅데이터를 활용한 편의점 간편식에 대한 의미 분석 (A study on the User Experience at Unmanned Checkout Counter Using Big Data Analysis)

  • 김애숙;류기환;정주희;김희영
    • 문화기술의 융합
    • /
    • 제8권4호
    • /
    • pp.375-380
    • /
    • 2022
  • 본 연구는 빅데이터를 활용하여 편의점 간편식에 대한 소비자들의 인식과 의미를 알아보기 위한 목적이 있다. 이 연구를 위하여 네이버(NAVER)와 다음(Daum)에서 뉴스, 지식인, 블로그, 카페, 지식인(팁), 웹 문서를 대상으로 분석하였고 자료 검색을 위한 키워드로는 '편의점 간편식'을 사용하였다. 자료 분석 기간은 2019년 1월1일부터 2021년 12월 31일까지 3년으로 선정하였다. 자료수집 및 분석을 위해서는 텍스톰(TEXTOM)을 사용하여 빈도 및 매트릭스 데이터를 추출하였고 UCINET 6 프로그램의 NetDraw 기능을 이용해 네트워크 분석과 시각화 분석을 실시하였다. 그 결과 편의점 간편식을 소비자들의 선택속성에 따라 건강성, 다양성, 간편성, 경제성으로 군집화 하였다. 직접 조리한 음식에 뒤떨어지지 않고 한 끼 식사로 그 종류가 다양하며, 적절한 가격, 할인 쿠폰, 이벤트 등 편의점 간편식에 대한 소비자들의 의미와 선택속성을 바탕으로 간편성과 편의성을 추구하는 변화된 생활방식에 맞는 새로운 간편식 메뉴 개발에 기초 자료가 되기를 기대한다.

제 4차 산업혁명 중심의 사물인터넷 지적 구조 시각화 (Visualization of the Intellectual Structure on the Internet of Things Focuses on the Industry 4.0)

  • 임혜정;서창교
    • 한국산업정보학회논문지
    • /
    • 제27권6호
    • /
    • pp.127-140
    • /
    • 2022
  • 최근 정보통신기술(ICT)의 발달로 산업혁명은 3차 산업에서 4차 산업으로 옮겨가고 있다. 기업이 미래에 생존하기 위해서는 이러한 기술을 채택해야 한다는 것에는 의심의 여지가 없다. 본 연구의 목적은 제4차 산업혁명을 위한 사물인터넷(IoT) 연구 문헌의 지적 구조를 분석하여 해당 분야에 대한 더 나은 통찰력을 제시하는 것이다. 연구 데이터는 Web of Science 데이터베이스에서 추출되었으며, CiteSpace를 사용하여 총 1,631개의 문서와 72,754개의 참고 문헌을 분석하였다. 저자동시인용분석을 이용하여 제4차 산업혁명을 위한 사물인터넷 연구 분야의 지적 구조를 분석하기 위해 군집분석, 타임라인 분석, 연구전환점 분석을 수행하여 'Supply Chain', 'Digital Twin', 'Smart Manufacturing System' 등 12개의 하위 영역을 식별하였다. 타임라인 분석을 통해 연구가 확대되고 있는 분야와 축소되고 있는 분야를 분석하였으며, 연구의 한계점과 향후 연구방향을 결론과 함께 제시하였다.

과학기술정책 연구와 사회, 정부 : 과학기술의 사회이슈, 정부정책, 학술연구의 공진화 분석 (Science and Technology Policy Studies, Society, and the State : An Analysis of a Co-evolution Among Social Issue, Governmental Policy, and Academic Research in Science and Technology)

  • 권기석;정서화;이찬구
    • 기술혁신학회지
    • /
    • 제21권1호
    • /
    • pp.64-91
    • /
    • 2018
  • 이 연구의 목적은 우리나라에서 과학기술정책 연구가 본격적으로 등장한 이래 과학기술을 둘러싼 사회이슈, 학술연구, 과학기술정책이 어떻게 상호작용해 왔는지 탐색하는 데에 있다. 과학기술정책 연구가 시대적 수요를 얼마나 수용해 왔는지, 문제해결을 위해 얼마나 적절하게 대응해 왔는지 분석하였다. 이를 위해 크게 사회이슈, 학술연구, 그리고 과학기술정책의 텍스트에 대한 네트워크분석과 군집분석을 실시하였다. 먼저, 과거 20년 동안 과학기술 관련 언론 기사를 중심으로 사회이슈를 분석하였다. 다음으로, 과학기술정책 연구논문과 정부문서를 각각 분석해봄으로써 사회문제로 제기된 과학기술 관련 정책수요들이 연구를 통해 정부정책으로 이어졌는지 분석하였다. 분석 결과, 과학기술정책 연구는 통합적인 시각보다는 주로 급변하는 기술혁신에 발 빠르게 움직이는 단편적 연구가 많다고 할 수 있다. 그러나 다음 시기에서는 연구주제의 성숙도를 높이면서, 사회적 반응성을 높이는 공진화 경향을 보여 주었다. 이러한 과정에서 삼자간 시차 현상 또한 확인할 수 있었다. 향후 과학기술정책 연구는 기존의 미시수준의 연구에서 중범위와 거시수준으로 확장되어야 할 것이다. 특히 과학기술의 정책과정과 공공관리에 관심을 가져야하며, 사회적 이슈에 대한 민감성을 높이는 정책의제설정 등에 대한 연구가 필요하다는 시사점을 도출하였다.

빅데이터 분석을 통한 무인계산대 사용자 경험에 관한 연구 (A study on the User Experience at Unmanned Checkout Counter Using Big Data Analysis)

  • 김애숙;정선미;류기환;김희영
    • 문화기술의 융합
    • /
    • 제8권2호
    • /
    • pp.343-348
    • /
    • 2022
  • 본 연구는 SNS 빅데이터를 활용하여 소비자들이 인지하는 무인계산대에 대한 사용자 경험을 분석하고자 한다. 이 연구를 위하여 네이버(NAVER)와 다음(Daum)에서 블로그, 뉴스, 지식인, 카페, 지식인(팁), 웹 문서를 대상으로 분석하였고 자료 검색을 위한 키워드는 '무인계산대'를 사용하였다. 자료 분석 기간을 2020년 1월1일부터 2021년 12월 31일까지 2년으로 선정하였다. 자료수집 및 분석을 위해서는 텍스톰(TEXTOM)을 통하여 빈도 및 매트릭스 데이터를 추출하였고 UCINET 6 프로그램의 NetDraw 기능을 이용해 네트워크 분석과 시각화 분석을 실시하였다. 그 결과 무인계산대는 소비자들의 경험요소 정의에 따라 접근성, 사용성, 지속사용의도, 기타로 군집화하였다. 공급자 측면에서 최저임금 인상과 근로시간 단축에 따른 문제를 해결하기 위해 무인계산대가 무분별하게 확산된다면 사회적 관점에서 더 큰 고용문제가 발생할 것이다. 아울러 무인계산에 익숙하지 않은 노인과 젊은 세대, 어린이, 외국인 등을 위해 쉽고 편리한 무인계산대 보급을 위한 제도화가 필요하다.

Social awareness of Arduino and artificial intelligence using big data analysis

  • Eun-Sang, Lee
    • 한국컴퓨터정보학회논문지
    • /
    • 제28권1호
    • /
    • pp.189-199
    • /
    • 2023
  • 이 연구의 목적은 빅데이터 분석 방법으로 확인한 사회적 인식을 기반으로 인공지능과 관련된 아두이노 기반 보드의 개발 방향을 확인하는 데 있다. 이를 위해 텍스톰 사이트를 통해 '아두이노+인공지능', '아두이노+AI' 등의 키워드를 중심으로 빅데이터를 추출하였고, 이 데이터를 텍스톰 사이트와 UNICET 프로그램을 이용하여 정제 및 분석하였다. 이 연구에서는 빈도 분석, TF-IDF 분석, 연결 중심성 분석, N-gram 분석, CONCOR 분석 등의 빅데이터 분석을 수행하였다. 분석 결과 아두이노 및 인공지능 관련 인터넷 문서에서는 교육 및 코딩 교육과 관련된 키워드, 아두이노를 기반으로 제작 및 체험 관련 키워드, 프로그램 관련 키워드가 주요 키워드임을 확인하였으며, 이들 키워드를 바탕으로 한 군집이 형성됨을 확인하였다. 이 연구를 통해 아두이노 및 인공지능과 관련된 사회적 인식을 파악하였고, 이를 기반으로 한 보드 개발의 방향성을 확인할 수 있었다. 이 연구는 일반 대중의 사회적 인식을 빅데이터 분석 방법을 활용하여 파악한 후, 이를 기반으로 보드 개발의 여러 가지 요인들을 확인하였다는 점에서 의의가 있다. 이 연구는 빅데이터 분석 방법으로 사용자의 요구를 파악하고자 하는 연구자나 개발자들이 참고할 수 있는 자료로 활용될 수 있을 것이다.