• 제목/요약/키워드: Image-to-image Translation

검색결과 306건 처리시간 0.027초

Facial Feature Based Image-to-Image Translation Method

  • Kang, Shinjin
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제14권12호
    • /
    • pp.4835-4848
    • /
    • 2020
  • The recent expansion of the digital content market is increasing the technical demand for various facial image transformations within the virtual environment. The recent image translation technology enables changes between various domains. However, current image-to-image translation techniques do not provide stable performance through unsupervised learning, especially for shape learning in the face transition field. This is because the face is a highly sensitive feature, and the quality of the resulting image is significantly affected, especially if the transitions in the eyes, nose, and mouth are not effectively performed. We herein propose a new unsupervised method that can transform an in-wild face image into another face style through radical transformation. Specifically, the proposed method applies two face-specific feature loss functions for a generative adversarial network. The proposed technique shows that stable domain conversion to other domains is possible while maintaining the image characteristics in the eyes, nose, and mouth.

Multi Cycle Consistent Adversarial Networks for Multi Attribute Image to Image Translation

  • Jo, Seok Hee;Cho, Kyu Cheol
    • 한국컴퓨터정보학회논문지
    • /
    • 제25권9호
    • /
    • pp.63-69
    • /
    • 2020
  • 이미지-이미지 변환은 입력 이미지를 통해서 목적 이미지를 만들어내는 기술로 최근 비지도 학습 구조인 GAN을 활용하여 더 실제와 같은 이미지를 만들어내는 높은 성과를 보였다. 이에 따라 GAN을 활용한 이미지-이미지 변환 연구는 다양하게 진행되고 있다. 이때 일반적으로 이미지-이미지 변환은 하나의 속성 변환을 목표한다. 그러나 실제 생활에서 사용되고 얻을 수 있는 자료들은 한 가지 특징으로 설명하기 힘든 다양한 특징으로 이루어진다. 그래서 다양한 속성을 활용하기 위하여 속성별로 이미지 생성 과정을 나누어 학습할 수 있도록 하는 다중 속성 변화를 목표로 한다면 더 이미지-이미지 변환의 역할을 잘 수행할 수 있을 것이다. 본 논문에서는 GAN을 활용한 이미지-이미지 변환 구조 중 높은 성과를 보인 CycleGAN을 활용해 이중 속성 변환 구조인 Multi CycleGAN을 제안한다. 이 구조는 입력 도메인을 두 가지의 속성에 대하여 학습하기 위하여 3개의 도메인이 양방향 학습을 진행하는 이중 변환 구조를 구현하였다. 새로운 구조를 통해 생성된 이미지와 기존 이미지-이미지 변환 구조들을 통해 생성된 이미지를 비교할 수 있도록 실험을 진행하였다. 실험 결과 새로운 구조를 통한 이미지는 입력 도메인의 속성을 유지하며 목표한 속성이 적용되는 높은 성능을 보였다. 이 구조를 활용한다면 앞으로 더 다양한 이미지를 생성하는 일이 가능지기 때문에 더 다양한 분야에서의 이미지 생성의 활용을 기대할 수 있다.

RAPGAN와 RRDB를 이용한 Image-to-Image Translation의 성능 개선 (Performance Improvement of Image-to-Image Translation with RAPGAN and RRDB)

  • 윤동식;곽노윤
    • 사물인터넷융복합논문지
    • /
    • 제9권1호
    • /
    • pp.131-138
    • /
    • 2023
  • 본 논문은 RAPGAN(Relativistic Average Patch GAN)과 RRDB(Residual in Residual Dense Block)을 이용한 Image-to-Image 변환의 성능 개선에 관한 것이다. 본 논문은 Image-to-Image 변환의 일종인 기존의 pix2pix의 결점을 보완하기 위해 세 가지 측면의 기술적 개선을 통한 성능 향상을 도모함에 그 목적이 있다. 첫째, 기존의 pix2pix 생성자와 달리 입력 이미지를 인코딩하는 부분에서 RRDB를 이용함으로써 더욱 더 깊은 학습을 가능하게 한다. 둘째, RAPGAN 기반의 손실함수를 사용해 원본 이미지가 생성된 이미지에 비해 얼마나 진짜 같은지를 예측하기 때문에 이 두 이미지가 모두 적대적 생성 학습에 영향을 미치게 된다. 마지막으로, 생성자를 사전학습시켜 판별자가 조기에 학습되는 것을 억제하도록 조치한다. 제안된 방법에 따르면, FID 측면에서 기존의 pix2pix보다 평균 13% 이상의 우수한 이미지를 생성할 수 있었다.

위치이동에 무관한 지문인식 정합 알고리즘에 관한 연구 (A Study on the Translation Invariant Matching Algorithm for Fingerprint Recognition)

  • 김은희;조성원;김재민
    • 대한전기학회논문지:시스템및제어부문D
    • /
    • 제51권2호
    • /
    • pp.61-68
    • /
    • 2002
  • This paper presents a new matching algorithm for fingerprint recognition, which is robust to image translation. The basic idea of this paper is to estimate the translation vector of an imput fingerprint image using N minutiae at which the gradient of the ridge direction field is large. Using the estimated translation vector we select minutiae irrelevant to the translation. We experimentally prove that the presented algorithm results in good performance even if there are large translation and pseudo-minutiae.

열화상 영상의 Image Translation을 통한 Pseudo-RGB 기반 장소 인식 시스템 (Pseudo-RGB-based Place Recognition through Thermal-to-RGB Image Translation)

  • 이승현;김태주;최유경
    • 로봇학회논문지
    • /
    • 제18권1호
    • /
    • pp.48-52
    • /
    • 2023
  • Many studies have been conducted to ensure that Visual Place Recognition is reliable in various environments, including edge cases. However, existing approaches use visible imaging sensors, RGB cameras, which are greatly influenced by illumination changes, as is widely known. Thus, in this paper, we use an invisible imaging sensor, a long wave length infrared camera (LWIR) instead of RGB, that is shown to be more reliable in low-light and highly noisy conditions. In addition, although the camera sensor used to solve this problem is an LWIR camera, but since the thermal image is converted into RGB image the proposed method is highly compatible with existing algorithms and databases. We demonstrate that the proposed method outperforms the baseline method by about 0.19 for recall performance.

다중 스케일 영상을 이용한 GAN 기반 영상 간 변환 기법 (GAN-based Image-to-image Translation using Multi-scale Images)

  • 정소영;정민교
    • 문화기술의 융합
    • /
    • 제6권4호
    • /
    • pp.767-776
    • /
    • 2020
  • GcGAN은 기하학적 일관성을 유지하며 영상 간 스타일을 변환하는 딥러닝 모델이다. 그러나 GcGAN은 회전이나 반전(flip) 등의 한정적인 기하 변환으로 영상의 형태를 보존하기 때문에 영상의 세밀한 형태 정보를 제대로 유지하지 못하는 단점을 가지고 있다. 그래서 본 연구에서는 이런 단점을 개선한 새로운 영상 간 변환 기법인 MSGcGAN(Multi-Scale GcGAN)을 제안한다. MSGcGAN은 GcGAN을 확장한 모델로서, 다중 스케일의 영상을 동시에 학습하여 스케일 불변 특징을 추출함으로써, 영상의 의미적 왜곡을 줄이고 세밀한 정보를 유지하는 방향으로 영상 간 스타일 변환을 수행한다. 실험 결과에 의하면 MSGcGAN은 GcGAN보다 정량적 정성적 측면에서 모두 우수하였고, 영상의 전체적인 형태 정보를 잘 유지하면서 스타일을 자연스럽게 변환함을 확인할 수 있었다.

SkelGAN: A Font Image Skeletonization Method

  • Ko, Debbie Honghee;Hassan, Ammar Ul;Majeed, Saima;Choi, Jaeyoung
    • Journal of Information Processing Systems
    • /
    • 제17권1호
    • /
    • pp.1-13
    • /
    • 2021
  • In this research, we study the problem of font image skeletonization using an end-to-end deep adversarial network, in contrast with the state-of-the-art methods that use mathematical algorithms. Several studies have been concerned with skeletonization, but a few have utilized deep learning. Further, no study has considered generative models based on deep neural networks for font character skeletonization, which are more delicate than natural objects. In this work, we take a step closer to producing realistic synthesized skeletons of font characters. We consider using an end-to-end deep adversarial network, SkelGAN, for font-image skeletonization, in contrast with the state-of-the-art methods that use mathematical algorithms. The proposed skeleton generator is proved superior to all well-known mathematical skeletonization methods in terms of character structure, including delicate strokes, serifs, and even special styles. Experimental results also demonstrate the dominance of our method against the state-of-the-art supervised image-to-image translation method in font character skeletonization task.

물체 변형 성능을 향상하기 위한 U-net 및 Residual 기반의 Cycle-GAN (U-net and Residual-based Cycle-GAN for Improving Object Transfiguration Performance)

  • 김세운;박광현
    • 로봇학회논문지
    • /
    • 제13권1호
    • /
    • pp.1-7
    • /
    • 2018
  • The image-to-image translation is one of the deep learning applications using image data. In this paper, we aim at improving the performance of object transfiguration which transforms a specific object in an image into another specific object. For object transfiguration, it is required to transform only the target object and maintain background images. In the existing results, however, it is observed that other parts in the image are also transformed. In this paper, we have focused on the structure of artificial neural networks that are frequently used in the existing methods and have improved the performance by adding constraints to the exiting structure. We also propose the advanced structure that combines the existing structures to maintain their advantages and complement their drawbacks. The effectiveness of the proposed methods are shown in experimental results.

Sign Language Image Recognition System Using Artificial Neural Network

  • Kim, Hyung-Hoon;Cho, Jeong-Ran
    • 한국컴퓨터정보학회논문지
    • /
    • 제24권2호
    • /
    • pp.193-200
    • /
    • 2019
  • Hearing impaired people are living in a voice culture area, but due to the difficulty of communicating with normal people using sign language, many people experience discomfort in daily life and social life and various disadvantages unlike their desires. Therefore, in this paper, we study a sign language translation system for communication between a normal person and a hearing impaired person using sign language and implement a prototype system for this. Previous studies on sign language translation systems for communication between normal people and hearing impaired people using sign language are classified into two types using video image system and shape input device. However, existing sign language translation systems have some problems that they do not recognize various sign language expressions of sign language users and require special devices. In this paper, we use machine learning method of artificial neural network to recognize various sign language expressions of sign language users. By using generalized smart phone and various video equipment for sign language image recognition, we intend to improve the usability of sign language translation system.

피부 미세요소 조절을 통한 얼굴 영상 합성 (Facial Image Synthesis by Controlling Skin Microelements)

  • 김유진;박인규
    • 방송공학회논문지
    • /
    • 제27권3호
    • /
    • pp.369-377
    • /
    • 2022
  • 최근 딥러닝 기반의 얼굴 합성 연구는 전체적인 스타일이나 헤어, 안경, 화장과 같은 요소를 포함하는 매우 사실적인 얼굴을 생성하는 결과를 보인다. 그러나 피부의 미세 구조와 같은 매우 세부적인 수준의 얼굴은 생성하지 못한다. 본 논문에서는 이러한 한계점을 극복하고자 한 장의 얼굴 라벨 영상으로부터 피부 미세 요소의 종류와 강도 조절을 통해 더욱 사실적인 얼굴 영상을 합성하는 기법을 제안한다. 제안하는 기법은 Image-to-Image Translation 방법인 Pix2PixHD를 이용해 얼굴 영역과 피부 요소인 주름, 모공, 홍조가 표시된 라벨 영상을 변환하여 미세 요소가 추가된 얼굴 영상을 생성한다. 피부 요소 영역을 조절한 라벨 영상을 다양하게 생성함으로써 이에 대응하는 미세한 피부 요소가 반영된 다양한 사실적인 얼굴 영상을 생성할 수 있음을 실험을 통해 보인다.