• Title/Summary/Keyword: 데이터 학습 세트

Search Result 217, Processing Time 0.026 seconds

Korean Instruction Tuning Dataset (언어 번역 모델을 통한 한국어 지시 학습 데이터 세트 구축)

  • Yeongseo Lim;HyeonChang Chu;San Kim;Jin Yea Jang;Minyoung Jung;Saim Shin
    • Annual Conference on Human and Language Technology
    • /
    • 2023.10a
    • /
    • pp.591-595
    • /
    • 2023
  • 최근 지시 학습을 통해 미세 조정한 자연어 처리 모델들이 큰 성능 향상을 보이고 있다. 하지만 한국어로 학습된 자연어 처리 모델에 대해 지시 학습을 진행할 수 있는 데이터 세트는 공개되어 있지 않아 관련 연구에 큰 어려움을 겪고 있다. 본 논문에서는 T5 기반 한국어 자연어 처리 모델인 Long KE-T5로 영어 데이터 세트를 번역하여 한국어 지시 학습 데이터 세트를 구축한다. 또한 구축한 데이터 세트로 한국어로 사전 학습된 Long KE-T5 모델을 미세 조정한 후 성능을 확인한다.

  • PDF

A study on the standardization strategy for building of learning data set for machine learning applications (기계학습 활용을 위한 학습 데이터세트 구축 표준화 방안에 관한 연구)

  • Choi, JungYul
    • Journal of Digital Convergence
    • /
    • v.16 no.10
    • /
    • pp.205-212
    • /
    • 2018
  • With the development of high performance CPU / GPU, artificial intelligence algorithms such as deep neural networks, and a large amount of data, machine learning has been extended to various applications. In particular, a large amount of data collected from the Internet of Things, social network services, web pages, and public data is accelerating the use of machine learning. Learning data sets for machine learning exist in various formats according to application fields and data types, and thus it is difficult to effectively process data and apply them to machine learning. Therefore, this paper studied a method for building a learning data set for machine learning in accordance with standardized procedures. This paper first analyzes the requirement of learning data set according to problem types and data types. Based on the analysis, this paper presents the reference model to build learning data set for machine learning applications. This paper presents the target standardization organization and a standard development strategy for building learning data set.

Performance analysis of deep learning based hologram watermarking according to hologram data (홀로그램 데이터에 따른 딥 러닝 기반 홀로그램 워터마킹의 성능 분석)

  • Lee, Ju-Won;Lee, Jae-Eun;Seo, Young-Ho;Kim, Dong-Wook
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2020.07a
    • /
    • pp.647-649
    • /
    • 2020
  • 본 논문에서는 홀로그램 영상 콘텐츠의 지적재산권 보호를 위하여 워터마킹을 딥 러닝을 기반으로 하는 네트워크로 수행한다고 가정하고, 이 네트워크를 학습시킬 때 학습 데이터 세트를 어떻게 구성하는 것이 워터마킹 네트워크에 가장 효율적인지에 대해, JPEG Pleno에서 표준 데이터 세트로 제공하고 있는 홀로그램들을 사용하여 분석한다. 이 홀로그램들의 표준편차에 따라 학습 데이터세트의 구성을 달리하여 동일한 워터마킹 네트워크에 학습시킨 후 학습에 사용되지 않은 시험 데이터세트를 시험하여 나온 결과의 비가시성과 워터마크, 데이터의 추출률을 비교함으로써 학습 데이터세트 구축 방식에 대해 분석한다.

  • PDF

An Enhanced Deep Learning for Animal Image Based on Small Datasets (적은 데이터 세트를 기반으로 한 동물 이미지의 향상된 딥 러닝)

  • Shin, Seong-Yoon;Shin, Kwang-Seong;Lee, Hyun-Chang
    • Proceedings of the Korean Society of Computer Information Conference
    • /
    • 2020.01a
    • /
    • pp.247-248
    • /
    • 2020
  • 본 논문은 동물 이미지 분류를 한 작은 데이터 세트를 기반으로 개선 된 딥 러닝 방법을 제안한다. 먼저, 소규모 데이터 세트에 대한 훈련 모델을 구축하기 위한 CNN이 사용되는 반면, 데이터 보강은 훈련 세트의 데이터 샘플을 확장하는 데 사용한다. 둘째, VGG16과 같은 대규모 데이터 세트에서 사전 훈련 된 네트워크를 사용하여 소규모 데이터 세트의 병목 현상 기능을 추출하여 두 개의 NumPy 파일에 새로운 학습 데이터 세트 및 테스트 데이터 세트로 저장한다. 마지막으로 새로운 데이터 세트로 완전히 연결된 네트워크를 학습한다.

  • PDF

Deep Learning for Pet Image Classification (애완동물 분류를 위한 딥러닝)

  • Shin, Kwang-Seong;Shin, Seong-Yoon
    • Proceedings of the Korean Institute of Information and Commucation Sciences Conference
    • /
    • 2019.05a
    • /
    • pp.151-152
    • /
    • 2019
  • In this paper, we propose an improved learning method based on a small data set for animal image classification. First, CNN creates a training model for a small data set and uses the data set to expand the data set of the training set Second, a bottleneck of a small data set is extracted using a pre-trained network for a large data set such as VGG16 and stored in two NumPy files as a new training data set and a test data set, finally, learn the fully connected network as a new data set.

  • PDF

Landmark recognition through image searcher (이미지 검색기를 통한 랜드마크 인식)

  • Gi-Duk Kim;Geun-Hoo Lee
    • Proceedings of the Korean Society of Computer Information Conference
    • /
    • 2024.01a
    • /
    • pp.313-315
    • /
    • 2024
  • 본 논문에서는 이미지 검색기를 통한 랜드마크 인식 방법을 제안한다. 특정 랜드마크 데이터세트에서 라벨링을 하지 않은 비지도 학습을 통해서 이미지에서 랜드마크의 클래스 분류를 위한 특징을 추출한다. 학습된 모델을 랜드마크 데이터세트인 Paris6k 데이터세트와 Oxford5k 데이터세트에 적용하여 랜드마크 인식 정확도를 확인하였다. 성능과 속도를 강화하기 위해 이미지 특징 추출 모델로 ResNet 대신에 YOLO에서 사용된 CSPDarknet-53을 사용하여 모델의 크기를 줄이고 랜드마크 인식 정확도를 높였다. 그리고 모델로부터 추출된 특징의 수를 줄여 이미지 검색 시 소요되는 시간을 감소시켰다. 학습된 모델로 rOxford5k 데이터 세트에 적용 시 mAP 80.37, rParis6k에서 mAP 89.07을 얻었다.

  • PDF

Learning data production technique for visual optimization of generative models (생성모델의 시각적 최적화를 위한 학습데이터 제작기법)

  • Cho, Hyeongrae;Park, Gooman
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • fall
    • /
    • pp.13-14
    • /
    • 2021
  • 본 논문은 생성모델의 학습데이터 제작기법에 대한 실험 및 결과와 향후 관련 연구의 방향을 기술한다. GAN으로 대표되는 생성모델이 아티스트에게 얼마만큼의 만족도와 영감을 주는지를 비교 실험 및 평가하기 위해서는 정제된 학습데이터가 필요하다. 하지만 현실적으로 아티스트의 작품은 데이터 세트를 만들기에는 그 수가 적고 인공지능이 학습하기에도 정제되어있지 않다. 2차 가공작업을 통하여 아티스트의 원본 작업과 유사한 데이터 세트의 구축은 생성모델의 성능향상을 위해 매우 중요하다. 연구의 결과 생성모델이 표현하기 어려운 스타일의 작가 작품을 선정한 뒤 최적의 학습데이터를 만들기 위한 다양한 실험과 기법을 통해 구축한 데이터 세트를 생성모델 알고리즘에 적용하고 실험을 통해 창작자의 작품제작 의도인 작가 진술에 최대한 유사한 이미지의 생성과 더 나아가 작가가 생각하지 못했던 창조적 모방의 결과물을 도출하였고 작가평가를 통해 높은 만족도를 얻었다.

  • PDF

Facial Expression Recognition through Self-supervised Learning for Predicting Face Image Sequence

  • Yoon, Yeo-Chan;Kim, Soo Kyun
    • Journal of the Korea Society of Computer and Information
    • /
    • v.27 no.9
    • /
    • pp.41-47
    • /
    • 2022
  • In this paper, we propose a new and simple self-supervised learning method that predicts the middle image of a face image sequence for automatic expression recognition. Automatic facial expression recognition can achieve high performance through deep learning methods, however, generally requires a expensive large data set. The size of the data set and the performance of the algorithm are tend to be proportional. The proposed method learns latent deep representation of a face through self-supervised learning using an existing dataset without constructing an additional dataset. Then it transfers the learned parameter to new facial expression reorganization model for improving the performance of automatic expression recognition. The proposed method showed high performance improvement for two datasets, CK+ and AFEW 8.0, and showed that the proposed method can achieve a great effect.

A Study on Training Data Selection Method for EEG Emotion Analysis using Semi-supervised Learning Algorithm (준 지도학습 알고리즘을 이용한 뇌파 감정 분석을 위한 학습데이터 선택 방법에 관한 연구)

  • Yun, Jong-Seob;Kim, Jin Heon
    • Journal of IKEEE
    • /
    • v.22 no.3
    • /
    • pp.816-821
    • /
    • 2018
  • Recently, machine learning algorithms based on artificial neural networks started to be used widely as classifiers in the field of EEG research for emotion analysis and disease diagnosis. When a machine learning model is used to classify EEG data, if training data is composed of only data having similar characteristics, classification performance may be deteriorated when applied to data of another group. In this paper, we propose a method to construct training data set by selecting several groups of data using semi-supervised learning algorithm to improve these problems. We then compared the performance of the two models by training the model with a training data set consisting of data with similar characteristics to the training data set constructed using the proposed method.

Discrete Wavelet Transform Network based on Deep Learning (딥러닝 기반 이산웨이블릿변환 네트워크)

  • Lee, Ju-Won;Park, Chan-Seung;Yoon, Young-Jae;Kim, Dong-Wook
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2020.11a
    • /
    • pp.347-350
    • /
    • 2020
  • 본 논문에서는 영상 변환 기술인 이산웨이블릿변환(Discrete Wavelet Transform, DWT)를 딥러닝 기반의 네트워크로 구현한다. 딥러닝 기술 중에도 CNN 기반으로 네트워크를 설계하였으며, 본 DWT 네트워크는 해상도에 의존적이지 않은 계층들로만 구성된다. 데이터세트를 구성할 때 파이썬의 라이브러리를 사용하여 레이블 데이터세트를 구성한다. 128×128크기의 gray-scale 영상을 입력으로 사용하고 이에 대응하는 레이블 데이터세트를 구성하여 1-level DWT를 수행하는 네트워크의 학습을 진행한다. 역방향 변환도 네트워크 설계 후 데이터세트를 구성하여 학습을 진행한다. 학습이 완료된 1-level DWT 네트워크를 반복적으로 사용하여 Multi-level DWT 네트워크를 구성한다. 또한 양자화에 의한 간단한 영상압축 실험을 진행하여 DWT 네트워크의 성능과 압축 등의 응용분야에 활용할 수 있음을 보인다. 설계한 DWT 네트워크의 1-level 순방향 변환 성능은 42.18dB의 PSNR을 보였고, 1-level 역방향 변환 성능은 50.13dB의 PSNR을 보였다.

  • PDF