• 제목/요약/키워드: 데이터 기반 모델

검색결과 6,206건 처리시간 0.057초

온라인저장소, 클라우드기반 JupyterHub와 모델 APIs를 활용한 수자원 모델링의 재현성 개선 (Advancing Reproducibility in Hydrological Modeling: Integration of Open Repositories, Cloud-Based JupyterHub, and Model APIs)

  • 최영돈
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2022년도 학술발표회
    • /
    • pp.118-118
    • /
    • 2022
  • 지속적인 학문의 발전을 위해서는 선행연구에 대한 재현성이 무엇보다도 중요하다고 할 수 있다. 하지만 컴퓨터와 소프트웨어의 급속한 발달로 인한 컴퓨터 환경의 다양화, 분석 소프트웨어의 지속적 최신화로 인해서 최근 구축된 모델도 짧게는 몇 달, 길게는 1~2년후면 다양한 에러로 인하여 재현성이 불가능해지고 있다. 이러한 재현성의 극복을 위해서 온라인을 통한 데이터와 소스코드의 공유의 필요성이 제시되고 있으나, 실제로는 개인마다 컴퓨터 환경, 버전, 소프트웨어 설치에 필요한 라이브러리의 버전 또는 디렉토리 등이 달라 단순히 온라인을 통한 데이터와 소스코드의 공유만으로 재현성을 개선하기는 힘든 것이 현실이다. 따라서 이러한 컴퓨터 모델링 환경의 공유는 과거의 형태와 같이 데이터, 소스코드와 매뉴얼의 공유만으로 불가능하다고 할 수 있다. 따라서 본 연구에서는 수자원 모델링의 재현성 개선을 위해 1) 온라인 저장소, 2) 클라우드기반 JupyterHub 모델링 환경과 3) 모델 APIs 3개의 핵심 구성요소를 제시하고, 최근 미국에서 개발된SUMMA(Structure for Unifying Multiple Modeling Alternative) 수자원 모델에 적용하여 재현성 달성을 위한 3개의 핵심 구성요소의 필요성과 용이성을 검증하였다. 첫 번째, 데이터와 모델의 온라인 공유는 FAIR(Findable, Accessible, Interoperable, Reusable) 원칙으로 개발된 수자원분야의 대표적인 온라인 저장소인 HydroShare를 활용하여 모델입력자료를 메타데이터와 함께 공유하였다. 두 번째, HydroShare에서 Web App의 형태로 제공되는 클라우드기반 JupyterHub환경인 CUAHSI JupyterHub(CJH)와 일루노이대학에서 제공하는 CyberGIS-Jupyter for water JupyterHub(CJW)환경에 수자원모델링 환경을 컨테이너(Docker) 환경을 통해 구축·공유하였다. 마지막으로, 클라우드에서 수자원모델의 효율적 이용을 위해 Python기반의SUMMA모델 API인 pySUMMA를 개발·공유하였다. 이와같이 구축된 3개의 핵심 구성요소를 이용하여 2015년 Water Resources Research에 게재된 SUMMA 논문의 9개 Test Cases 중에서 5개를 누구나 쉽게 재현할 수 있음을 증명하였다. 재현성의 중요성에 대한 인식의 증가로 Open과 Transparent Hydrology에 대한 요구가 증대되고 있으며, 이를 위해서 클라우드 기반의 모델링 환경구축 및 제공이 확대되고 있다. 본 연구에서 제시한 HydroShare와 같은 온라인 저장소, CJH와 CJW와 같은 클라우드기반 모델링환경, 모델의 효율적 이용을 위한 모델 APIs는 급속도로 발달하고 있는 컴퓨터 및 소프트웨어 환경에서 핵심구성요소이며, 연구의 재현성 개선을 통해 수자원공학 발전에 기여할 것으로 기대된다.

  • PDF

공공데이터 기반 고용보험 가입 예측 모델 개발 연구 (A Development on a Predictive Model for Buying Unemployment Insurance Program Based on Public Data)

  • 조민수;김도현;송민석;김광용;정충식;김기대
    • 한국빅데이터학회지
    • /
    • 제2권2호
    • /
    • pp.17-31
    • /
    • 2017
  • 빅데이터의 중요성이 증가함에 따라 공공기관에서는 다양한 빅데이터 관련 인프라를 제공하고 있으며, 그 중 하나가 공공데이터이다. 공공데이터 기반의 다양한 활용 사례가 공유되고 있으며, 공공기관에서도 데이터 기반의 모델을 통해 공공의 문제를 해결하려는 움직임을 보이고 있다. 대표적으로 사회 보험 중 하나인 고용보험 케이스가 있다. 고용보험은 근로자의 권익 보호를 위해 근로자를 고용한 모든 사업주가 필수적으로 가입하여야 하는 보험이지만 가입누락의 경우가 많다. 가입누락을 막기 위한 데이터 기반의 접근이 필요하지만, 분산된 형태의 공공데이터, 수집 시기의 차이로 인해 데이터 통합이 어렵고, 체계적인 방법론이 부재한 상황이다. 본 논문에서는 공공데이터를 기반의 고용보험 가입 예측을 위한 모델 도출방법론을 제시하고자 한다. 본 방법론은 데이터 수집, 데이터 통합 및 전처리, 데이터 탐색 및 이력 데이터 분석, 예측 모델 도출을 포함하며, 프로세스 마이닝 및 데이터 마이닝을 활용한다. 또한, 사례 연구를 통해 본 방법론의 유효성을 검증한다.

  • PDF

e-비즈니스 Paperless Transaction을 위한 데이터 모델 및 처리 시스템 설계 (The Design of Data Model and Process System for e-Business Paperless Transaction)

  • 박순호;안경림;민성기
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2008년도 추계학술발표대회
    • /
    • pp.623-626
    • /
    • 2008
  • 점차 종이 서류 기반의 전자거래 방식에서 전자적 메시지를 통한 전자거래 방식으로 업무가 처리되고 있다. 그러나 업무의 특성 상 여전히 종이 서류로 처리해야 하는 경우가 존재하고 있다. 즉 전자 문서를 통해 데이터를 수신받았다 할 지라도 증빙을 위해 사용자는 이와 별도로 종이 서식 문서를 제출해야만 한다. 이에 국제 표준화 기구인 UN/CEFACT은 paperless transaction을 위해 UNeDocs를 제안하였고 종이 서식으로 유통되는 여러 업무에 대해 전자적인 서식 데이터를 정의하고 있다. UNeDocs 기반의 전자 서식 데이터는 데이터 뿐만 아니라 서식 정보까지 포함하고 있으며 이를 바로 출력할 수 있도록 하고 있다. 이로서 이중으로 데이터를 생성할 필요가 없고 표준화된 데이터가 교환됨으로 인해 사용의 편이성을 제공하고 확장성을 보장할 수 있게 된다. 본 논문에서는 UNeDocs 기반의 데이터 모델을 UN/CEFACT에서 권고하는 방식으로 정의하고 정의된 데이터 모델을 기반으로 다양한 형태로 변환할 수 있는 시스템을 설계하고자 한다. 설계된 시스템을 통해 입력 데이터를 UNeDocs 기반의 데이터로 변환할 수 있게 됨으로 e-비즈니스에서의 paperless transaction을 지원할 수 있게 된다.

UFID를 이용한 객체기반 수치지도 공간 데이터 모델 (Spatial Data Model of Feature-based Digital Map using UFID)

  • 김형수;김상엽;이양구;서성보;박기석;류근호
    • 한국공간정보시스템학회 논문지
    • /
    • 제11권1호
    • /
    • pp.71-78
    • /
    • 2009
  • 최근 ITS, 텔레매틱스, 유비쿼터스 등의 도입으로 공간 데이터는 다양한 환경에 응용되거나 활용 분야가 점차 증가하고 있고, 수치지도를 일반인들에게 제공함으로써 공간 데이터에 대한 수요가 급증하고 있다. 기존의 수치지도 관리 시스템은 도엽이라는 일정한 단위로 구분하여 공간 데이터를 관리하고 있기 때문에 데이터의 구축은 용이하지만 객체 단위의 데이터 구축, 관리 및 갱신을 효율적으로 지원하기 어렵다. 따라서 이 논문에서는 이러한 문제를 해결하기 위하여 객체기반의 연속적인 지형지물 표현, 공간 데이터의 객체별 이력관리 및 수시갱신이 가능한 객체기반의 데이터 모델을 제안하였다. 제안 모델에서 객체기반 공간 데이터는 각 지형지물에 UFID를 부여하고 도엽 단위로 구축된 수치지도 데이터의 조인 연산을 통해 연속적인 지형지물을 표현하였다. 아울러 갱신으로 인한 변경 데이터를 이력 DB에 시간간격 단위로 저장, 관리하였으며, 제안된 모델의 효율성을 검증하기 위하여 타당성을 분석하였다.

  • PDF

Aspect model 기반의 차원 축소를 이용한 유전자 발현데이터 분석 (Gene Expression Pattern Analysis Using Aspect Model-based Dimensionality Reduction)

  • 장정호;엄재홍;김유섭;장병탁
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 가을 학술발표논문집 Vol.31 No.2 (1)
    • /
    • pp.247-249
    • /
    • 2004
  • 본 논문에서는 aspect model을 이용한 차원 축소 기반의 유전자 발현 데이터 분석을 제시한다. Aspect model은 은닉변수모델의 하나로서, 이를 이용하여 유전자 발현 데이터에 대한 확률적 학습 과정을 통해 특징적 발현 패턴을 추출할 수 있다. 또한 모델로부터 커널함수를 유도함으로써 발현패턴에 기반한 유전자간의 유사도를 자연스럽게 측정할 수 있다. 모델에 의해 정의되는 은닉공간 차원 수는 데이터 permutation 기반의 검증을 통해 결정한다. 효모 (yeast)의 세포 주기(cell cycle) 관련 발현데이터네 대한 실험에서, 주기별 특징 발현 패턴을 추출할 수 있었다. 또한 aspect model로부터 유도된 커널 기반의 유사도 척도를 이용함으로써, 동일 기능 또는 동일 complex 범주에 속하는 유전자 쌍 예측에서 기본적인 상관계수에 의한 방법에 비해 보다 향상된 성능을 얻을 수 있었다.

  • PDF

딥러닝 기반 집-나무-사람 검사 분석 모델의 개발 (Development of Deep Learning-Based House-Tree-Person Test Analysis Model)

  • 조승제;조건우;김영욱
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2021년도 추계학술발표대회
    • /
    • pp.558-561
    • /
    • 2021
  • 심리학에서 사람의 심리 상태를 알아보기 위해 사용되는 검사 방법 중, 집-나무-사람 검사(HTP Test)는 피실험자가 그린 집, 나무, 사람을 포함하는 그림을 사용하여 피실험자의 심리를 분석하는 투영 검사법이다. 본 논문에서는 딥러닝 모델을 이용해 HTP Test 에 사용되는 그림을 분석하는 시스템을 제안하며, 성능 평가를 통해 심리학에서의 딥러닝 모델 적용 가능성을 확인한다. 또한 그림 데이터 분석에 적합한 사전 훈련 모델을 개발하기 위해, ImageNet 과 스케치 데이터셋으로 사전 훈련하여 성능을 비교한다. 본 논문에서 제안하는 시스템은 크게 감정 분석을 위한 이미지 객체 추출부, 추출된 객체로 피실험자의 감정을 분류하는 감정 분류부로 구성되어 있다. 객체 추출과 이미지 분류 모두 CNN(Convolution Neural Network) 기반의 딥러닝 모델을 사용하며, 이미지 분류 모델은 서로 다른 데이터셋으로 모델을 사전 훈련한 후, 훈련 데이터셋으로 전이 학습하여 모델의 성능을 비교한다. 그림 심리 분석을 위한 HTP test 스케치 데이터셋은, HTP Test 와 동일하게 피실험자가 3 개 클래스의 집, 나무, 사람의 그림을 그려 자체 수집하였다.

KorBERT 기반 빈칸채우기 문제를 이용한 텍스트 분류 (Text Classification using Cloze Question based on KorBERT)

  • 허정;이형직;임준호
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2021년도 제33회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.486-489
    • /
    • 2021
  • 본 논문에서는 KorBERT 한국어 언어모델에 기반하여 텍스트 분류문제를 빈칸채우기 문제로 변환하고 빈칸에 적합한 어휘를 예측하는 방식의 프롬프트기반 분류모델에 대해서 소개한다. [CLS] 토큰을 이용한 헤드기반 분류와 프롬프트기반 분류는 사전학습의 NSP모델과 MLM모델의 특성을 반영한 것으로, 텍스트의 의미/구조적 분석과 의미적 추론으로 구분되는 텍스트 분류 태스크에서의 성능을 비교 평가하였다. 의미/구조적 분석 실험을 위해 KLUE의 의미유사도와 토픽분류 데이터셋을 이용하였고, 의미적 추론 실험을 위해서 KLUE의 자연어추론 데이터셋을 이용하였다. 실험을 통해, MLM모델의 특성을 반영한 프롬프트기반 텍스트 분류에서는 의미유사도와 토픽분류 태스크에서 우수한 성능을 보였고, NSP모델의 특성을 반영한 헤드기반 텍스트 분류에서는 자연어추론 태스크에서 우수한 성능을 보였다.

  • PDF

가정용 협력 로봇의 센서 데이터 기반 실행동작 예측 모델 개발 (Development of Sensor Data-based Motion Prediction Model for Home Co-Robot)

  • 유성엽;유동연;박예슬;이정원
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2019년도 춘계학술발표대회
    • /
    • pp.552-555
    • /
    • 2019
  • 디지털 트윈이란 현실 세계의 물리적인 사물을 컴퓨터 상에 동일하게 가상화 시키는 기술을 의미하는 것으로, 물리적 사물이나 시스템을 모델링하거나 IoT 기술에 접목되어 활용되고 있는 기술이다. 디지털 트윈 기술은 가상의 모델을 무한정 시뮬레이션을 통해 동작을 튜닝하고 환경변화에 대한 대응을 미리 실험하여 리스크를 최소화할 수 있는 장점을 지닌다. 최근 인공지능이나 기계학습에 관련된 기술들이 주목받기 시작하면서, 이와 같은 물리적인 사물의 모델링 작업을 데이터 기반으로 수행하려는 시도가 증가하고 있다. 특히, 산업현장에서 많이 활용되는 인더스트리 4.0 공장 자동화의 핵심인 협력 로봇의 디지털 트윈을 구축하기 위해서는 로봇의 동작을 인지하는 과정이 필수적으로 요구된다. 그러나 현재 협력 로봇의 동작을 인지하기 위한 시도는 미비하며, 센서 데이터를 기반으로 동작을 역으로 예측하는 기술은 더욱 그렇다. 따라서 본 논문에서는 로봇의 동작을 인지하기 위해 가정용 협력 로봇에서 전류 및 관성 데이터를 수집하기 위한 실험 환경을 구축하고, 수집한 센서 데이터를 기반으로 한 동작 예측 모델을 제안하고자 한다. 제안하는 방식은 로봇의 동작 명령어를 조인트 위치 기반으로 분류하고 전류와 위치 센서 값을 사용하여 학습을 통해 예측하는 방식이다. SVM 을 이용하여 학습한 결과, 모델의 성능은 평균적으로 정확도, 정밀도, 및 재현율이 모두 96%로 평가되었다.

휴대형 DMB 단말 환경에서의 시나리오 기반 데이터 방송 부가콘텐츠 제작 모델 연구 (A Study about Data Broadcasting Sub-Content Architecture Model Using Scenario in Mobile DMB Device Environment)

  • 오정민;김경록;문남미
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2007년도 한국컴퓨터종합학술대회논문집 Vol.34 No.1 (C)
    • /
    • pp.139-143
    • /
    • 2007
  • 양방향 데이터 방송 기술이 급속도로 발전하고 전세계적으로 표준화가 진행되고 있는 가운데 데이터 방송 콘텐츠에 대한 수요는 제자리를 맴돌고 있다. 이는 특화된 데이터 방송 콘텐츠에 대한 필요성을 의미하는 것으로 본 논문에서는 시나리오를 기반으로 기존 방송 콘텐츠를 활용하여 데이터 방송 부가 콘텐츠를 제작하는 모델안을 제안한다. 연구 모델은 1)시나리오 기반으로 기존 데이터 방송 콘텐츠 분석, 2)분석된 객체 아이템 메타데이터 스키마 설계 3)부가 콘텐츠 화면 구현의 단계로 구성한다. DMB 단말환경에서 가볍게 움직이는 콘텐츠 제작을 위해 메타데이터를 25개로 제한하고 이 안에서 Content Description, Shot Detection, Object Tracking로 메타데이터를 구분하여 스키마 다이어그램을 설계한다. 본 논문은 기존의 익숙한 콘텐츠를 재가공하여 제공함으로 DMB 수요 활성화 측면과 CP의 제작 비용감소 측면에서 긍정적인 영향을 끼칠 것으로 예상된다.

  • PDF

사전학습 된 언어 모델 기반의 양방향 게이트 순환 유닛 모델과 조건부 랜덤 필드 모델을 이용한 참고문헌 메타데이터 인식 연구 (A Study on Recognition of Citation Metadata using Bidirectional GRU-CRF Model based on Pre-trained Language Model)

  • 지선영;최성필
    • 정보관리학회지
    • /
    • 제38권1호
    • /
    • pp.221-242
    • /
    • 2021
  • 본 연구에서는 사전학습 된 언어 모델을 기반으로 양방향 게이트 순환 유닛 모델과 조건부 랜덤 필드 모델을 활용하여 참고문헌을 구성하는 메타데이터를 자동으로 인식하기 위한 연구를 진행하였다. 실험 집단은 2018년에 발행된 학술지 40종을 대상으로 수집한 PDF 형식의 학술문헌 53,562건을 규칙 기반으로 분석하여 추출한 참고문헌 161,315개이다. 실험 집합을 구축하기 위하여 PDF 형식의 학술 문헌에서 참고문헌을 분석하여 참고문헌의 메타데이터를 자동으로 추출하는 연구를 함께 진행하였다. 본 연구를 통하여 가장 높은 성능을 나타낸 언어 모델을 파악하였으며 해당 모델을 대상으로 추가 실험을 진행하여 학습 집합의 규모에 따른 인식 성능을 비교하고 마지막으로 메타데이터별 성능을 확인하였다.