• 제목/요약/키워드: 데이터 분석론

검색결과 1,383건 처리시간 0.029초

웹 애플리케이션 기반의 텍스트 데이터 분석 모델 (Text Data Analysis Model Based on Web Application)

  • 진고환
    • 한국콘텐츠학회논문지
    • /
    • 제21권11호
    • /
    • pp.785-792
    • /
    • 2021
  • 4차 산업혁명 이후 인공지능, 빅 데이터와 같은 기술들의 발전으로 사회 전반에 다양한 변화가 일어나고 있으며, 핵심적인 기술 적용 과정에서 수집할 수 있는 데이터의 양도 급속하게 증가하고 있는 추세이다. 특히 학계에서는 연구 동향을 파악하기 위하여 기존에 생성된 문헌 데이터에 대한 분석이 이루어지고 있으며, 이러한 문헌 분석은 연구의 흐름을 정리하고, 어떤 연구 방법론이나 주제, 또는 현재 학계에서 화두가 되고 있는 대상에 대한 파악을 통하여 향후 연구 방향 설정에 많은 기여를 하고 있는 상황이다. 그러나 문서 데이터의 분석을 위하여 데이터 수집이 필요하나, 일반적으로 프로그램에 대한 전문 지식이 없는 경우 접근하기 어렵다. 본 논문에서는 텍스트 마이닝 기반의 토픽 모델링 웹 애플리케이션 모델을 제안한다. 제안 모델을 통하여 데이터 분석 기법에 대한 전문적인 지식이 부족하더라도, 연구 논문의 수집, 저장, 텍스트 분석과 같은 다양한 작업을 진행할 수 있으며, 연구자들이 선행 연구 분석과 연구 동향을 파악하기 위하여 데이터 분석에 투입되는 시간 및 노력을 단축시킬 수 있을 것으로 기대된다.

빅데이터 보안 분야의 연구동향 분석 (A Review of Research on Big Data Security)

  • 박서기;황경태
    • 정보화정책
    • /
    • 제23권1호
    • /
    • pp.3-19
    • /
    • 2016
  • 본 연구의 목적은 빅데이터 보안 분야의 기존 연구를 분석하고, 향후 연구 방향을 모색하는 것이다. 이를 위해 국내외의 총62편의 논문을 식별하여, 발간년도, 게재 매체, 전반적인 연구접근 방법, 세부적 연구 방법, 연구 주제 등을 분석하였다. 분석 결과, 빅데이터 보안 연구는 매우 초기 단계로서, 비실증 연구가 압도적인 비중을 차지하고 있고, 관련 개념/기법에 대한 이해를 해나가는 과정으로서 기술-관리-통합의 단계로 진화한 정보보안 분야의 연구 동향에 동조하여 기술적인 연구가 주로 진행되고 있다. 연구 주제 측면에서도 빅데이터 보안에 대한 전반적인 이슈를 다룬 총론적인 연구들이 보안 구현 방법론, 분야별 이슈 등의 각론적 연구에 비해 높은 비중을 나타내는 등 초기 단계의 모습을 나타내고 있다. 향후 유망한 연구 분야로는 빅데이터 보안에 대한 전반적인 프레임워크 수립, 업종별 빅데이터 보안에 대한 연구, 빅데이터 보안 관련 정부 정책 분석 등을 들 수 있다. 빅데이터 보안 분야의 연구는 본격적으로 시작된 지 얼마 되지 않아, 연구 결과가 상대적으로 매우 부족한 편이다. 앞으로 다양한 관점에서 빅데이터 보안과 관련해 풍부한 주제를 다루는 연구가 진행되기를 기대한다.

POT방법론을 이용한 자동차보험 손해율 추정 (Estimation of Car Insurance Loss Ratio Using the Peaks over Threshold Method)

  • 김수영;송종우
    • 응용통계연구
    • /
    • 제25권1호
    • /
    • pp.101-114
    • /
    • 2012
  • 자동차보험의 손해율이란 지급보험금의 수입보험료에 대한 비율을 의미한다. 손해율이 매우 큰 값을 갖는 대형손실이 일어나는 경우에는 보험회사의 재무적인 부분에 큰 악영향을 미치게 된다. 따라서 보험회사가 이에 대비할 수 있도록 하기 위하여 손해율의 극단 분위수(extreme quantile)를 추정하는 것은 매우 중요한 일이다. 다른 종류의 보험 관련 데이터와 같이 손해율의 분포는 오른쪽으로 긴 꼬리를 갖는 두꺼운 꼬리분포(heavy-tailed distribution)를 갖는다. 이런 자료에서 극단 분위수룰 추정하기 위하여 가장 많이 사용되는 방법론은 POT(Peaks over threshold)와 Hill 추정(Hill estimation)이다. 본 논문에서는 일반화파레토분포(generalized Pareto distribution; GPD)의 다양한 모수추정방법론의 성능을 모의실험과 실제 손해율 데이터를 사용하여 비교, 분석하였다. 또한 Hill 추정치를 사용하여 극단 분위수를 추정하였다. 그 결과 대부분의 경우에 POT 방법론이 Hill 추정치를 이용한 방법보다 정확한 분위수를 추정하였고, 모수추정방법론 중에서는 MLE, Zhang, NLS-2 방법론이 가장 좋은 결과를 보여주었다.

한국어 노인 음성 데이터 증강 및 인식 연구 (A Study of Data Augmentation and Auto Speech Recognition for the Elderly)

  • 김건희;박서윤;김한샘
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2023년도 제35회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.56-60
    • /
    • 2023
  • 기존의 음성인식은 청장년 층에 초점이 맞추어져 있었으나, 최근 고령화가 가속되면서 노인 음성에 대한 연구 필요성이 증대되고 있다. 그러나 노인 음성 데이터셋은 청장년 음성 데이터셋에 비해서는 아직까지 충분히 확보되지 못하고 있다. 본 연구에서는 부족한 노인 음성 데이터셋 확보에 기여하고자 희소한 노인 데이터셋을 증강할 수 있는 방법론에 대해 연구하였다. 이를 위해 노인 음성 특징(feature)을 분석하였으며, '주파수'와 '발화 속도' 특징을 일반 성인 음성에 합성하여 데이터를 증강하였다. 이후 Whisper small 모델을 파인 튜닝한 뒤 노인 음성에 대한 CER(Character Error Rate)를 구하였고, 기존 노인 데이터셋에 증강한 데이터셋을 함께 사용하는 것이 가장 효과적임을 밝혀내었다.

  • PDF

병렬 분산파일시스템의 성능 분석을 통한 최적화 연구 (Study of Optimization through Performance Analysis of Parallel Distributed Filesystem)

  • 윤준원;송의성
    • 디지털콘텐츠학회 논문지
    • /
    • 제17권5호
    • /
    • pp.409-416
    • /
    • 2016
  • 최근 빅데이터 이슈가 화두가 됨에 따라 대학, 산업체, 연구소 등에서는 다양한 데이터들을 수집, 분석 하려는 노력이 활성화 되고 있다. 여기에는 과거부터 축적된 데이터, 현재에 바로 분석이 불가능하더라도 잠재적인 의미를 가지고 있는 데이터 등 대량의 데이터들이 수집되어 의미론적인 분석을 통해 가치 있는 분석결과를 얻게 된다. 이를 위해 전 세계적으로 대용량의 데이터 요구를 처리 할 수 있는 고성능 스토리지 시스템의 수요가 증가하고 있다. 또한, 여러 사용자들에게 축적된 대량의 데이터에 동시에 접속하여 다양한 분석을 수행할 수 있도록 안정성 있는 병렬 분산파일시스템을 제공해야 한다. 본 연구에서는 위와 같이 안정성 있는 파일시스템을 제공하기 위해 반드시 고려되어야 할 스토리지 시스템의 I/O 대역폭, 메타데이터의 성능 등을 파악하고 최적의 환경을 구성하기 위한 방법을 제시하고자 한다.

유비쿼터스 홈 네트워크 인터페이스 모델링을 위한 사용자 행태 분석 방법론 연구 (A Study on User Behavior Analysis Methodology for Modeling Ubiquitous Home Network Interface)

  • 김예진;서윤숙;김영철
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2005년도 추계학술발표대회 및 정기총회
    • /
    • pp.267-270
    • /
    • 2005
  • 최근에 사용자 행태 분석 개념이 매우 중요한 이슈가 되고 있다. 하지만 SE(Software Engineering)와 HCI(Human-Computer Interaction) 두 분야의 틈으로 HCI 관점의 시스템 모델링을 위한 적절한 모델링 언어나 도구가 부족하다. 그리고 원시 데이터를 분석하여 사용자 행위를 모델링하는 것은 실제로 어려운 작업이다. 이 논문에서는 목적(Goal)지향의 사용자 행위 분석을 통해 객체를 식별하고, 추출한 공통/비공통 행위를 기반으로 시스템을 모델링 하고자 UBA(User Behavior Analysis)방법론을 제안한다. 그리고 유비쿼터스 환경의 홈 네트워크 인터페이스 모델을 적용 사례로 언급하였다.

  • PDF

가상재화의 현금거래가 비즈니스에 미치는 영향 : 온라인게임 아이템 현금 거래를 중심으로

  • 전성민;이보경
    • 한국벤처창업학회:학술대회논문집
    • /
    • 한국벤처창업학회 2019년도 추계학술대회
    • /
    • pp.45-49
    • /
    • 2019
  • 본 연구는 온라인 게임 아이템과 같은 가상재화가 현금 거래될 경우 온라인 게임 비즈니스에 미치는 영향을 정량적으로 추정하려 했다. 기존 연구문헌에서 온라인 상거래와 모바일 앱 유통에서 활용된 롱테일 분포 계량 추정 방법론을 이용하여 추정한 결과, 온라인 게임 거래소의 거래 아이템 총액은 약 1조 5천억 원으로 추정되었다. 이 중, 전문적인 작업장 매출 규모는 연간 약 8,700억원으로 아이템 중개 거래 사이트 게임 머니 및 게임 아이템 거래 총액 대비 58% 수준으로 추정되었다. 본 연구는 학문적 분석이 매우 제한된 온라인 게임 상의 가상재화 아이템의 현금거래에 대한 정량적 분석 시도라는 점에서 의의를 가지며 특히, 작업장 및 작업장의 게임에 미치는 영향을 정량 분석한 거의 최초의 연구이다. 다만, 아이템 거래시장에 대한 데이터 및 게임 운영에 대한 내부 정보가 제한되어 연구문헌에 기초를 둔 추정방법론을 활용하였으며 게임 산업계의 전문가들의 의견을 반영하여 추정한 분석 결과이다. 또한 본 연구는 작업장 및 불법 서버로 말미암아 발생하는 사회적 비용 등을 온라인 게임 서비스 제공 회사에 일방적 책임을 갖게 하는 것 보다는 사회 전반적인 관점에서 접근해야 한다는 정책적 시사점을 제시한다.

  • PDF

DEVS 형식론 기반의 재겨냥성 하둡 시뮬레이션 환경 개발 (Development of Retargetable Hadoop Simulation Environment Based on DEVS Formalism)

  • 김병수;강봉구;김탁곤;송해상
    • 한국시뮬레이션학회논문지
    • /
    • 제26권4호
    • /
    • pp.51-61
    • /
    • 2017
  • 최근 빅 데이터가 증가하는 추세에 따라 이를 분석 및 처리하고 활용하는 방안에 대한 관심도 증대되고 있다. 이러한 빅 데이터를 저장, 관리하기 위한 대표적인 플랫폼으로 분산 컴퓨팅 프레임워크인 맵리듀스와 분산 파일 시스템인 HDFS로 구성된 하둡 플랫폼이 있다. 하둡은 일반적으로 수백 수천 대 이상의 클러스터로 구축되는데, 이 때 실제 클러스터 구성이나 파라미터에 따라 하둡 플랫폼이 가지는 효과도를 분석하는 것이 중요하다. 하지만 수천 대 이상의 클러스터 구축하여 이를 분석하는 것이 실질적으로 어렵기 때문에 모델링 및 시뮬레이션 기법을 통해 분석하는 것이 필요하다. 본 논문은 계층적이고 모듈러한 모델링이 가능한 DEVS 형식론을 기반으로 하둡 시뮬레이션 환경을 제안한다. 제안하는 시뮬레이션 환경은 하둡 실행 결과를 이용한 입력 모델 설계를 통해 어플리케이션의 특성을 잘 반영할 수 있으며, 파라미터/알고리즘/모델들을 다양하게 변경하여 실험할 수 있는 재겨냥성 환경을 제공한다. 또한 사용자 편의성의 극대화를 위해 사용자 인터페이스, 실시간 모델 뷰어, 입력 시나리오 편집기를 제공한다. 본 논문에서는 어플리케이션 실행 결과와의 비교를 통해 하둡 시뮬레이터를 검증하고, 다양한 파라미터에 대한 실험을 진행한다.

Map/Reduce를 이용한 블로그 연결망 분석 시스템 설계 (The Design of Blog Network Analysis System using Map/Reduce Programming Model)

  • 조인휘;박재균
    • 한국통신학회논문지
    • /
    • 제35권9B호
    • /
    • pp.1259-1265
    • /
    • 2010
  • 최근, 인터넷의 발달로 인해 온라인 사회연결망이 증가하고 있으며 이 중 블로그 서비스가 대표적이다. 본 논문에서는 블로그 연결망을 분석하기 위한 방법론을 제시하며, 대용량의 연결망 데이터를 안정적으로 분산 처리할 수 있는 방안을 제시한다. 우선, 각 연결망 데이터의 시간 경과에 따른 행위 가중치의 값을 보정하여, 최근의 행위가 과거의 행위보다 높은 연결강도를 가질 수 있도록 한다. 둘째로, 명시적으로 연결행위를 가지지 않은 블로그의 경우 블로그의 성격을 대표할 수 있는 키워드간의 유사도를 추출하여, 묵시적으로 연결망 내에 흡수하도록한다. 따라서 이전의 방법론과는 달리 더 많은 블로그 노드 간의 연결을 분석할 수 있다. 본 논문이 제시한 블로그 연결망 분석 시스템의 설계로 기존에 제시되었던 방법론보다 약 40% 더 많은 블로그 간 연결망을 추출 할 수 있음을 보였으며, 시간의 흐름에 따른 연결강도의 변화에 대한 타당성을 입증하였다.

초등 예비교사가 모의수업 시연에서 구성한 과학적 추론의 인식론적 의미 - 증거-설명 연속선의 관점 - (Epistemological Implications of Scientific Reasoning Designed by Preservice Elementary Teachers during Their Simulation Teaching: Evidence-Explanation Continuum Perspective)

  • 맹승호
    • 한국초등과학교육학회지:초등과학교육
    • /
    • 제42권1호
    • /
    • pp.109-126
    • /
    • 2023
  • 이 연구는 초등 예비교사가 모의수업 시연에서 구성한 과학적 추론을 증거-설명의 연속선 관점에서 해석하여 그들의 과학적 추론이 갖는 인식론적 의미를 조사하였다. 연구를 위해 계절 변화에 관한 모의 수업을 시연한 예비교사 2명, 고기압과 저기압 및 바람에 관한 모의수업을 시연한 예비교사 2명이 연구 참여자로 선정되었다. 예비교사의 교수발화 중에서 귀납적, 연역적(가설-연역적) 추론, 또는 귀추적 추론의 사례가 드러난 에피소드에서 각 추론이 증거-설명의 연속선의 단계에서 어떤 역할을 하는지 비교하여 예비교사의 과학적 추론이 가진 인식론적 의미를 분석하였다. 계절 변화의 원인에 관한 모의수업을 시연했던 두 예비교사는 학생들이 수집한 데이터를 비교하여 증거를 인식하였고, 증거와 가설을 비교하여 가설을 검증하는 가설-연역적 추론을 활용하여 설명을 구성하였다. 고기압과 저기압 및 바람의 방향을 주제로 모의수업을 시연했던 두 예비교사는 모둠별 데이터를 종합하여 증거로 인식하는 귀납적 추론과 선형적 논리 구조를 가진 연역적 추론을 설명구성 전략으로 선택하여 최종 설명을 제시하였다. 연구에 참여한 예비교사들은 유사한 주제의 모의수업 시연에서 대체로 비슷한 흐름의 과학적 추론을 활용하여 과학지식을 구성하였으나, 증거-설명의 연속선에서 데이터, 증거, 모델, 설명으로 전개되는 인식론적 의미 측면에서 조금씩 다른 양상을 보였다. 또한, 일부 사례를 제외하면, 공통적으로 증거에서 모델을 탐색하는 과학적 추론은 부족하였으며, 가설이나 설명모델을 추리하기 위한 귀추적 추론이 부재하였다. 이 연구에서 분석틀로 적용했던 증거-설명의 연속선 접근은 과학적 추론의 인식론적 의미를 파악할 수 있게 하며 대안적인 과학적 추론 함양 지도 방법으로 사용될 수 있음을 논의하였다.