• 제목/요약/키워드: Data sparsity

검색결과 174건 처리시간 0.02초

희박 벡터자기상관회귀 모형을 이용한 한국의 미세먼지 분석 (The sparse vector autoregressive model for PM10 in Korea)

  • 이원석;백창룡
    • Journal of the Korean Data and Information Science Society
    • /
    • 제25권4호
    • /
    • pp.807-817
    • /
    • 2014
  • 본 논문은 최근 많은 관심을 받는 미세먼지 (PM10)의 일별 평균농도에 대해서 전국 16개 시도에서 2008년부터 2011년까지 관측한 다변량 시계열 자료에 대한 연구이다. 다변량 시계열 모형을 이용해서 시간 및 공간에 대한 상관관계를 동시에 고려, 일변량 혹은 특정 지역에 국한해서 분석한 기존의 연구와 차별성을 두었다. 또한 Davis 등 (2013)이 제안한 부분 스펙트럼 일관성 (partial spectral coherence)을 통해 다른 지역간의 상호 의존성을 파악하고 이를 토대로 변수 선택을 통해 희박벡터자기회귀모형 (sVAR; sparse vector autoregressive model)을 적합하는 방법론을 적용하여 고차원 자료 분석의 단점 및 한계를 보완하였으며 예측력 비교를 통해서 sVAR 모형 적합의 타당성을 검증하였다.

추천 시스템을 위한 단계적 평가치 예측 방안 (A Stepwise Rating Prediction Method for Recommender Systems)

  • 이수정
    • 한국인터넷방송통신학회논문지
    • /
    • 제21권4호
    • /
    • pp.183-188
    • /
    • 2021
  • 협력 필터링 기반의 추천 시스템은 현재 다양한 분야의 상업용 시스템의 필수불가결한 기능으로서, 사용자들이 선호할만한 상품을 맞춤형으로 제공해 주는 유용한 서비스이다. 그러나, 사용자들의 평가 데이타가 불충분할 경우 선호상품의 예측이 부정확할 우려가 크다. 본 연구에서는 이러한 단점을 해결하기 위하여 단계적으로 상품의 평가치를 예측하는 방안을 제시한다. 각 단계에 해당하는 예측 방법의 적용 조건을 만족하지 못할 경우 다음 단계의 방법을 적용한다. 제안 방법의 성능 평가를 위해, 공개 데이터셋을 활용한 실험을 진행하였으며, 제안 방법은 여러 전통적 유사도 척도를 도입한 협력 필터링 시스템의 예측 성능과 정밀도 성능을 크게 향상시켰고, 평가데이터 희소성 해결을 위한 기존 방식들의 성능을 능가하는 결과를 보였다.

Paper Recommendation Using SPECTER with Low-Rank and Sparse Matrix Factorization

  • Panpan Guo;Gang Zhou;Jicang Lu;Zhufeng Li;Taojie Zhu
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제18권5호
    • /
    • pp.1163-1185
    • /
    • 2024
  • With the sharp increase in the volume of literature data, researchers must spend considerable time and energy locating desired papers. A paper recommendation is the means necessary to solve this problem. Unfortunately, the large amount of data combined with sparsity makes personalizing papers challenging. Traditional matrix decomposition models have cold-start issues. Most overlook the importance of information and fail to consider the introduction of noise when using side information, resulting in unsatisfactory recommendations. This study proposes a paper recommendation method (PR-SLSMF) using document-level representation learning with citation-informed transformers (SPECTER) and low-rank and sparse matrix factorization; it uses SPECTER to learn paper content representation. The model calculates the similarity between papers and constructs a weighted heterogeneous information network (HIN), including citation and content similarity information. This method combines the LSMF method with HIN, effectively alleviating data sparsity and cold-start issues and avoiding topic drift. We validated the effectiveness of this method on two real datasets and the necessity of adding side information.

압축 센싱 기반의 신호 검출 및 추정 방법 (A Signal Detection and Estimation Method Based on Compressive Sensing)

  • 응웬뚜랑녹;정홍규;신요안
    • 한국통신학회논문지
    • /
    • 제40권6호
    • /
    • pp.1024-1031
    • /
    • 2015
  • 압축 센싱은 신호가 성긴 (Sparse) 특성을 지니며 선형 측정된 값들이 Incoherent 할 때, 나이퀴스트율 이하로 표본화된 신호를 원본 신호로 정확하게 복구할 수 있는 새로운 신호 획득 이론이다. 본 논문에서는 원본 신호의 Sparse한 정도에 따라 성능이 변화하는 압축 센싱을 이용한 효율적인 신호 검출 및 추정 기법을 제안하며, 이론적 분석과 함께 모의 실험 결과를 보여준다.

DUMMY모선을 고려한 상태추정 측정점선정 알고리즘에 관한 연구 (A Study on Measurement Selection Algorithm for Power System State Estimation Under the Consideration of Dummy Buses)

  • 문영현;이태식
    • 대한전기학회논문지
    • /
    • 제41권2호
    • /
    • pp.107-117
    • /
    • 1992
  • This paper presents an improved algorithm of optimal measurement design with a reliability evaluation method for a large power system. The proposed algorithm is developed to consider the dummy bus and to achieve highest accuracy of the state estimator as well with the limited investment cost. The dummy bus in the power system is impossible to install measurement meter, while real and reactive power measurements is considered in the proposed algorithm. On the other hand, P/C model is developed by taking advantage of the matrix sparsity. The improved program is successfully tested for KEPCO system with PSS/E lineflow calculated data package.

  • PDF

사회네트워크에서 사용자 행위정보를 활용한 퍼지 기반의 신뢰관계망 추론 모형 (A Fuzzy-based Inference Model for Web of Trust Using User Behavior Information in Social Network)

  • 송희석
    • Journal of Information Technology Applications and Management
    • /
    • 제17권4호
    • /
    • pp.39-56
    • /
    • 2010
  • We are sometimes interacting with people who we know nothing and facing with the difficult task of making decisions involving risk in social network. To reduce risk, the topic of building Web of trust is receiving considerable attention in social network. The easiest approach to build Web of trust will be to ask users to represent level of trust explicitly toward another users. However, there exists sparsity issue in Web of trust which is represented explicitly by users as well as it is difficult to urge users to express their level of trustworthiness. We propose a fuzzy-based inference model for Web of trust using user behavior information in social network. According to the experiment result which is applied in Epinions.com, the proposed model show improved connectivity in resulting Web of trust as well as reduced prediction error of trustworthiness compared to existing computational model.

  • PDF

사회네트워크에서 잠재된 신뢰관계망 추론을 위한 ANFIS 모형

  • 송희석
    • 한국데이타베이스학회:학술대회논문집
    • /
    • 한국데이타베이스학회 2010년도 춘계국제학술대회
    • /
    • pp.277-287
    • /
    • 2010
  • We are sometimes interacting with people who we know nothing and facing with the difficult task of making decisions involving risk in social network. To reduce risk, the topic of building Web of trust is receiving considerable attention in social network. The easiest approach to build Web of trust will be to ask users to represent level of trust explicitly toward another users. However, there exists sparsity issue in Web of trust which is represented explicitly by users as well as it is difficult to urge users to express their level of trustworthiness. We propose a fuzzy-based inference model for Web of trust using user behavior information in social network. According to the experiment result which is applied in Epinions.com, the proposed model show improved connectivity in resulting Web of trust as well as reduced prediction error of trustworthiness compared to existing computational model.

  • PDF

전자상거래에서 2-Way 혼합 협력적 필터링을 이용한 추천 시스템 (Recommendation System using 2-Way Hybrid Collaborative Filtering in E-Business)

  • 김용집;정경용;이정현
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2003년도 컴퓨터소사이어티 추계학술대회논문집
    • /
    • pp.175-178
    • /
    • 2003
  • Two defects have been pointed out in existing user-based collaborative filtering such as sparsity and scalability, and the research has been also made progress, which tries to improve these defects using item-based collaborative filtering. Actually there were many results, but the problem of sparsity still remains because of being based on an explicit data. In addition, the issue has been pointed out. which attributes of item arenot reflected in the recommendation. This paper suggests a recommendation method using nave Bayesian algorithm in hybrid user and item-based collaborative filtering to improve above-mentioned defects of existing item-based collaborative filtering. This method generates a similarity table for each user and item, then it improves the accuracy of prediction and recommendation item using naive Bayesianalgorithm. It was compared and evaluated with existing item-based collaborative filtering technique to estimate the accuracy.

  • PDF

개인화 된 추천시스템을 위한 사용자-상품 매트릭스 축약기법 (User-Item Matrix Reduction Technique for Personalized Recommender Systems)

  • 김경재;안현철
    • Journal of Information Technology Applications and Management
    • /
    • 제16권1호
    • /
    • pp.97-113
    • /
    • 2009
  • Collaborative filtering(CF) has been a very successful approach for building recommender system, but its widespread use has exposed to some well-known problems including sparsity and scalability problems. In order to mitigate these problems, we propose two novel models for improving the typical CF algorithm, whose names are ISCF(Item-Selected CF) and USCF(User-Selected CF). The modified models of the conventional CF method that condense the original dataset by reducing a dimension of items or users in the user-item matrix may improve the prediction accuracy as well as the efficiency of the conventional CF algorithm. As a tool to optimize the reduction of a user-item matrix, our study proposes genetic algorithms. We believe that our approach may relieve the sparsity and scalability problems. To validate the applicability of ISCF and USCF, we applied them to the MovieLens dataset. Experimental results showed that both the efficiency and the accuracy were enhanced in our proposed models.

  • PDF

타임라인데이터를 이용한 트위터 사용자의 거주 지역 유추방법 (Location Inference of Twitter Users using Timeline Data)

  • 강애띠;강영옥
    • Spatial Information Research
    • /
    • 제23권2호
    • /
    • pp.69-81
    • /
    • 2015
  • SNS사용자의 거주 지역을 유추하여 그들이 생성한 데이터에 거주위치를 부여하는 것은 위치희박(location sparsity)과 생태학적 오류문제로 인해 연구결과의 신뢰성이 떨어진다는 평가를 받아온 공간빅데이터 연구에 대안이 될 수 있다. 본 연구에서는 Tweet 사용자의 거주 지역을 유추하는 방법으로 사용자 타임라인데이터 속에서 찾아낸 일상생활활동패턴을 이용하는 방법을 고안하였다. 트윗 사용자의 일상생활활동패턴은 이동궤적과 사용자의 언어(text)에서 확인할 수 있었으며 전자를 활용한 모델을 일상이동패턴모델, 후자를 활용한 모델을 일상 활동장 모델이라 명명하고 각각 모델에 입력될 변수를 선정하였다. 자신의 거주 지역에서 가장 높은 빈도의 트윗 발생 여부와 가장 높은 빈도의 거주행정구역 표현 단어를 사용하는지 아닌지를 종속변수로 한 판별분석을 실시하여 모델을 작성하였으며 설명력은 일상 이동패턴모델, 일상 활동장 모델 각각 67.5%, 57.5%였다. 이 모델을 스트레스 관련 트윗을 작성한 사용자의 타임라인데이터로 구성된 테스트데이터에 입력해본 결과 전체 사용자 48,235명 중 5,301명의 거주 지역을 유추하였고 이를 활용하여 위치 부여된 스트레스 관련 트윗 9,606개를 확보하였다. 본 연구의 유추기법을 통해 기존 SNS데이터 분석연구에서 사용하는 데이터 수집 방법보다 44배 많은 위치 부여 트윗을 확보할 수 있었다. 본 연구방법론은 SNS데이터를 이용한 연구에서 위치 부여된 데이터를 확보하는데 활용 가능할 것으로 판단되며, 각종 지역통계와 상관관계파악을 통해 지역적 현상 분석에도 SNS데이터를 이용할 수 있는 가능성을 높일 것으로 판단된다.