• Title/Summary/Keyword: versatile video coding

Search Result 80, Processing Time 0.026 seconds

Object Detection Network Feature Map Compression using CompressAI (CompressAI 를 활용한 객체 검출 네트워크 피쳐 맵 압축)

  • Do, Jihoon;Lee, Jooyoung;Kim, Younhee;Choi, Jin Soo;Jeong, Se Yoon
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2021.06a
    • /
    • pp.7-9
    • /
    • 2021
  • 본 논문은 Detectron2 [1]에서 지원하는 객체 검출 임무 수행 네트워크의 과정 중에서 추출한 피쳐 맵을 신경망 기반으로 압축하는 방법을 제안한다. 이를 위해, 신경 망 기반 영상 압축을 지원하는 공개 소프트웨어인 CompressAI [2] 모델 중 하나인 bmshj2018-hyperprior 의 압축 네트워크를 활용하여 임무 수행 네트워크의 과정 중 스탬 레이어(stem layer)에서 추출된 피쳐 맵을 압축하도록 학습시켰다. 또한, 압축 네트워크의 입력 피쳐 맵의 너비와 높이 크기가 64 의 배수가 되도록 객체 검출 네트워크의 입력 영상 보간 값을 조정하는 방법도 제안한다. 제안하는 신경망 기반 피쳐 맵 압축 방법은 피쳐 맵을 최근 표준이 완료된 차세대 압축 표준 방법인 VVC(Versatile Video Coding, [3])로 압축한 결과에 비해 큰 성능 향상을 보이고, VCM 앵커와 유사한 성능을 보인다.

  • PDF

Improved CCLM by Considering Neighboring Pixel Information (주변 화소 정보를 추가로 고려한 CCLM 의 예측 성능 향상 방법)

  • Lee, Jeehwan;Kim, Bumyoon;Jeon, Byeungwoo
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2021.06a
    • /
    • pp.357-358
    • /
    • 2021
  • 본 논문에서는 VVC(Versatile Video Coding)의 색차 채널을 위한 화면 내 예측 모드 중 하나인 CCLM (Cross-Component Linear Model) 모드의 부호화 성능을 향상시킬 수 있는 방법을 제안하였다. 기존의 CCLM 모드는 예측과정에서 대응 휘도 영역의 화소로만 색차 블록의 예측자를 생성하기 때문에 현재 색차 블록과 그 주변의 참조 화소와의 연관성을 고려하지 않는 문제점이 있다. 본 논문에서는 참조 화소를 사용하는 예측 모드를 유도하여 예측자를 생성한 후 기존 CCLM 을 통해 생성된 예측자와 가중 결합하는 방법을 제안함으로써 문제점을 극복하고 부호화 성능의 향상을 가져오고자 한다. 실험 결과 제안 방법은 기존 VVC 방법 대비 BDBR 측면에서 Y(0.10%), Cb(-0.22%), Cr(-0.22%)의 결과를 얻을 수 있었다.

  • PDF

Analysis for the Number of Luma Blocks Corresponding to DM Chroma Block (DM 모드로 부호화된 색차블록에 대응하는 휘도 블록의 개수에 대한 분석)

  • Lee, Yujin;Kim, Bumyoon;Jeon, Byeungwoo
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2021.06a
    • /
    • pp.359-360
    • /
    • 2021
  • 본 논문에서는 차세대 비디오 부호화 기술인 VVC (Versatile Video Coding)의 색차 성분 화면 내 예측 기술인 DM (Derived Mode) 가 분할 구조가 이중 트리일 때 색차 블록에 대응하는 휘도 블록을 선택하는 기존 방식의 효율성을 분석하기 위해 색차 블록에 대응하는 휘도 영역 내 휘도 블록의 개수를 측정하였다. 실험 결과, 하나의 색차 블록에 대응하는 휘도 영역 내에 평균적으로 4.408 개의 휘도 블록이 존재함을 확인하였다. 따라서 DM 을 통한 부호화 시 대응하는 휘도 영역 내 복수개의 휘도 블록을 고려하여, 유도되는 최적의 예측 모드를 잘 선정하는 방법에 대한 연구가 필요하다.

  • PDF

Efficient Signaling of Extended GPM Modes in ECM (ECM 의 효율적인 GPM 확장 모드 시그널링 기법)

  • Moon, Gihwa;Lee, Jiwon;Park, Dohyeon;Kim, Jae-Gon
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2022.06a
    • /
    • pp.1236-1238
    • /
    • 2022
  • JVET 은 최신 비디오 부호화 표준인 VVC(Versatile Video Coding) 표준화를 완료한 후, VVC 보다 더 높은 압축 성능을 가지는 새로운 표준기술 탐색을 진행하고 있으며, 이를 위하여 참조 소프트웨어 ECM(Enhanced Compression Model)을 개발하고 있다. 현재 ECM4.0 에는 다양한 후보 구성 및 예측 성능 개선 기법을 추가하여 기존 VVC 의 GPM(Geometric Partitioning Mode)을 확장한 GPM-MMVD(GPM with merge MV differences), GPM-TM(GPM with template matching) 등을 채택하고 있다. 본 논문에서는 ECM 에 채택된 확장된 GPM 기술들의 각 기술 별 선택 빈도를 분석하고 이를 바탕으로 보다 효율적인 GPM 확장 모드 시그널링 방식을 제안한다. 또한 후보 탐색 알고리즘을 간소화한 복잡도 감소 기법을 제시한다. 실험결과 제안하는 시그널링 기법은 ECM4.0 대비 Y와 Cb, Cr 에서 각각 0.02%, 0.16%, 0.09% BD-rate 부호화 성능 향상을 보였고 GPM 인덱스 탐색 간소화 기법은 ECM4.0 대비 Y 와 Cr 에서 각각 0.02%, 0.18% BD-rate 부호화 성능 향상을 보였다.

  • PDF

Construction of Merge Candidate List Based on Adaptive Reordering of Merge Candidates (ARMC) in ECM (ECM 의 적응적 병합후보 재배열(ARMC) 기반 효율적인 병합후보 구성)

  • Moon, Gihwa;Kim, Ju-Hyeon;Park, Dohyeon;Kim, Jae-Gon
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2022.06a
    • /
    • pp.1239-1240
    • /
    • 2022
  • JVET 은 VVC(Versatile Video Coding) 표준화 완료 이후 보다 높은 압축 성능을 갖는 차세대 비디오 코덱의 표준 기술을 탐색하고 있으며 ECM(Enhanced Compression Model) 참조 소프트웨어를 통해 제안된 알고리즘의 성능을 검증하고 있다. 현재 ECM 에서는 정해진 순서에 의해 병합(Merge) 후보를 구성하고 템플릿 매칭(template matching)을 통하여 후보들의 순서를 재배열하는 ARMC(Adaptive Reordering of Merge Candidate) 기법을 채택하고 있다. 본 논문은 ARMC 의 병합 후보의 선택 빈도 분석을 바탕으로 정규 병합(regular merge) 후보 수를 확장하여 구성하고, 실제 탐색에 사용되는 최종 후보의 수를 제한하는 효율적인 ARMC 후보 구성 기법을 제안한다. 실험결과 ECM 4.0 대비 Cb 와 Cr 에서 0.12%, 0.19% 비디오 부호화 성능을 확인하였다.

  • PDF

Comparison of Image Compression Performance based on RoI Extraction Methods for Machines Vision (RoI 추출 방법에 따른 기계를 위한 영상 압축 성능 비교)

  • Lee, Yegi;Kim, Shin;Yoon, Kyoungro
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2022.06a
    • /
    • pp.146-149
    • /
    • 2022
  • 기존 RDO(Rate Distortion Optimization) 기반 압축 방식은 압축 성능에 초점을 두기 때문에 영상 내 인지 특성이 무시될 수 있다. 따라서 RoI(Region of Interest)을 기반으로 압축률을 조절하는 연구가 고안[1, 2, 3, 4] 되었으며, HVS(Human Visual System) 관점에서 영상 내 중요한 부분에 대해 더 높은 품질로 영상을 압축하는 연구가 대부분이다. 최근 인공지능 기술이 발전함에 따라 지능형 영상 분석에 대한 수요가 증가하고 있으며, 이에 따라 머신 비전을 위한 영상 부호화 및 효율적인 전송에 대한 필요성이 대두되고 있다. 본 논문에서는 VVC(Versatile Video Coding)의 dQP(delta Quantization Parameter)를 활용하여 RoI(Region of Interest) 기반압축 방법을 제안하고, 두가지의 RoI 추출 방식을 소개한다. Detectron2 Faster R-CNN X101-FPN [5]의 첫번째 탐지기를 통해 후보 영역 기반 RoI 을 추출하고, 두번째 탐지기를 통해 객체 기반 RoI 을 추출하여, 영상 내 객체 부분과 비객체 부분으로 나누어 서로 다른 압축률로 압축을 수행하였으며, 이에 따른 성능을 비교하고자 한다.

  • PDF

Selective Reference Line Sharing for Chroma Intra Prediction (채널 간 선택적 참조 라인 공유 방법)

  • Lee, Yujin;Park, Jeeyoon;Jeon, Byeungwoo
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2022.06a
    • /
    • pp.197-198
    • /
    • 2022
  • Versatile Video Coding (VVC)는 차세대 동영상 압축 표준화 과정에서 다수의 부호화 기술을 새롭게 채택하였는데, 이중 Multiple Reference Lines (MRL)을 포함한 일부 기술은 휘도 채널에만 적용될 수 있으며 색차 성분에 대해서는 적용이 고려되지 않는다. 본 논문은 VVC 에서 휘도 채널에만 적용되는 MRL 기술을 색차 채널로 확장하기 위하여, DM(Derived Mode)을 사용하는 색차 블록의 대응 휘도 블록이 MRL 을 사용하는 경우에 해당 참조 라인을 선택적으로 공유하여 색차 블록이 화면 내 예측에 복수개의 참조 라인을 고려하여 선택할 수 있도록 하는 방법을 제안한다. 실험 결과, VVC Test Model (VTM) 15.0 대비 Cb, Cr 성분 각각 -0.09%, -0.05%의 성능 향상을 보인다.

  • PDF

Enhanced intra prediction mode decision method for VVC (VVC 부호화기의 화면내 부호화 모드 결정 개선 방법)

  • Yun, ByungJin;Gwon, Daehyeok;Choe, JaeRyun;Choi, Haechul
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2019.11a
    • /
    • pp.191-193
    • /
    • 2019
  • ISO/IEC JTC1 WG11 Moving Picture Expers Group 과 ITU-T SC16 은 Joint Video Experts Team 을 구성하여 차세대 비디오 부호화 표준으로서 Versatile Video Coding(VVC)를 표준화 중이다. VVC 는 현재 블록의 화면내 예측 모드일 가능성이 높은 모드의 집합인 Most Probable Mode(MPM) 리스트를 유도하고, MPM 을 이용하여 효율적으로 화면내 예측 모드를 부호화한다. VVC 참조 소프트웨어는 주변 블록의 화면내 예측 모드가 일치하는지 여부에 따라 1 개 또는 2 개의 모드를 최종 후보 선택을 위한 과정인 Rate-Distortion Optimization(RDO) 과정에 추가한다. 하지만 현재 MPM 은 항상 첫 번째 후보로 Planar 모드가 위치하며 이로 인하여, 주변 블록의 화면내 예측 모드가 RDO 에 추가되지 않는 경우가 존재한다. 따라서 본 논문은 VVC 의 부호화기에서 주변 블록의 화면내 예측 모드가 고려되지 않는 경우가 존재하는 문제를 해결하기 위한 방법을 제안한다. 제안 방법은 MPM 유도 과정에서 RDO 에 포함할 후보의 개수를 수정하여 RDO 과정에 항상 주변 블록의 화면내 예측 모드가 추가되도록 한다. 본 논문은 실험을 통해 제안 방법이 약 0.04%의 부호화 효율을 향상시켰음을 보인다.

  • PDF

Implementing Motion-constrained Tile Set Based Tile Extractor on VVC (VVC 에서의 움직임 제한 타일 셋 기반 타일 추출기 구현)

  • Jeong, Jong-Beom;Lee, Soonbin;Ryu, Il-Woong;Kim, Sungbin;Kim, Inae;Ryu, Eun-Seok
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2020.07a
    • /
    • pp.6-9
    • /
    • 2020
  • 최근 몰입형 가상 현실을 제공하기 위한 360 도 영상 전송 기술이 활발히 연구되고 있다. 그러나 현재 가상현실 기기가 가지는 연산 능력 및 대역폭으로는 고화질의 360 도 영상을 전송 및 재생하기에 한계가 있다. 해당 문제점을 극복하기 위해 본 논문에서는 사용자 시점의 고화질 360 도 영상 제공을 위해 사용자 시점 타일을 추출하는 움직임 제한 타일 셋 기반 타일 추출기를 구현한다. Versatile video coding (VVC) 기반 타일 인코더를 이용해 360 도 영상에 대한 비트스트림을 생성한 후, 사용자 시점에 해당하는 타일들을 선택한다. 이후 선택된 타일들은 제안하는 타일 추출기에 의해 추출되고 전송된다. 또한, 전체 360 도 영상에 대한 저화질 비트스트림을 전송하여 갑작스러운 사용자 시점 변경에 대응한다. 제안된 타일 추출기를 기반으로 360 도 영상 전송을 수행하면, 기존 VVC 기반 시스템 대비 대비 평균 24.81%의 bjontegaard delta rate (BD-rate) 감소가 가능함을 확인하였다.

  • PDF

Luma Mapping Function Generation Method Using Attention Map of Convolutional Neural Network in Versatile Video Coding Encoder (VVC 인코더에서 합성 곱 신경망의 어텐션 맵을 이용한 휘도 매핑 함수 생성 방법)

  • Kwon, Naseong;Lee, Jongseok;Byeon, Joohyung;Sim, Donggyu
    • Journal of Broadcast Engineering
    • /
    • v.26 no.4
    • /
    • pp.441-452
    • /
    • 2021
  • In this paper, we propose a method for generating luma signal mapping function to improve the coding efficiency of luma signal mapping methods in LMCS. In this paper, we propose a method to reflect the cognitive and perceptual features by multiplying the attention map of convolutional neural networks on local spatial variance used to reflect local features in the existing LMCS. To evaluate the performance of the proposed method, BD-rate is compared with VTM-12.0 using classes A1, A2, B, C and D of MPEG standard test sequences under AI (All Intra) conditions. As a result of experiments, the proposed method in this paper shows improvement in performance the average of -0.07% for luma components in terms of BD-rate performance compared to VTM-12.0 and encoding/decoding time is almost the same.