I. 서론
TTS (Text to Speech)란 사람의 음성을 인공적으로 생성하는 음성 합성 기술의 일종으로, 텍스트를 음성으로 변환하는 기술이다[1]. 기존의 TTS 기술은 사람의 목소리에 비해 기계적이고 부자연스러운 표현의 한계가 존재하였다. 이러한 한계를 극복하기 위해 TTS 과정 중 모든 요소에 딥러닝을 적용하기 시작하였다. 이후, 모든 요소에 딥러닝을 적용한 음성 합성 기술인 딥보이스가 등장하였다[2]. 딥보이스 모델의 등장으로 기존 TTS에 비해 더욱 유연하고 자연스러운 음성 합성이 가능하게 되었다. 이후, 딥보이스 모델의 발전으로 음성 합성 기술은 단순한 텍스트 낭독을 넘어 화자의 발음 습관, 억양, 감정 등을 정교하게 모방할 수 있도록 고도화되었다. 이러한 기술은 고인의 생전 목소리 생성, 화자의 목소리를 통한 실시간 번역 등 긍정적인 사례를 만들어내며, 엔터테인먼트 사업, 교육산업 등 다방면으로 활용되고 있다. 하지만, 고도화된 음성 합성 기술은 보이스 피싱, 음성 스푸핑 등 심각한 악용 사례로도 이어지고 있다. 예를 들어, 피해자의 가족이나 지인의 목소리를 딥보이스로 생성하여 금전을 요구하는 보이스 피싱 사례가 다수 존재한다[3]. 또한, 유명인이나 정부 고위직의 목소리를 딥보이스로 모방해 악용하는 사례가 존재한다. 실제로 미국 연방수사국은 정부 고위 관료를 사칭하여 피해자들에게 악성 링크 접속을 유도하는 신종 딥보이스 사기 수법에 대해 주의를 당부하였다[4]. 따라서, 고도화된 음성 합성 기술의 악용을 막고 악용된 딥보이스 사전 탐지 및 차단 기술연구가 필요하다.
딥보이스 탐지 연구는 지속적으로 진행되고 있으나, 몇가지 한계가 존재한다. 첫째, 일부 연구는 특정 딥보이스 생성 모델 또는 제한된 환경에서 수집된 데이터에 기반하여 성능을 평가하였다. 이로 인해 특정 딥보이스 생성 모델에 종속되어 일반화의 한계가 존재한다[5]. 둘째, 학습 데이터와 평가 데이터 간 화자 분리가 충분히 이루어지지 않아, 새로운 화자에 대한 탐지 성능이 보장되지 않는 경우도 존재한다. 이러한 한계는 실제 수사 환경에서 신규 화자 및 신규 딥보이스 생성 플랫폼을 대상으로 탐지하는 상황에 딥보이스 탐지 성능을 저하시킬 수 있다.
본 논문에서는 생성 플랫폼 및 화자 변화에 강건한 딥보이스 탐지 모델을 식별하고, 활용 가능성을 제안하고자 한다. 이를 위해 트랜스포머 모델인 ViT(Vision Transformer), DeiT (Data-EfficientImage Transformers)와 Swin Transformer를 선정하였고, 추가로 MambaOut 모델을 선정하여 성능을 평가하였다. 트랜스포머 기반 모델은 시간적 순서를 갖는 음성 특징 간의 장거리 의존성을 효과적으로 학습할 수 있어, 화자 및 딥보이스 생성 방식이 변화하는 환경에서도 일반화 성능을 확보하는데 유리하다. 입력 표현으로는 프레임 단위로 추출한 MFCC 13계수를 시간 축으로 누적하여 이미지 형태로 변환한 뒤 모델에 입력하였다. MFCC는 인간 청각 특성이 반영된 저차원 특징으로 계산 효율성이 높고 잡음에 강인하며, 이미지 형태로의 변환은 비전 모델의 입력 구조와 자연스럽게 정합된다.
데이터 세트 측면에서는, 최근 딥보이스 탐지 연구에 ASVspoof와 같은 공용 벤치마크 데이터 세트가 널리 사용되고 있다. 이러한 데이터 세트는 연구 간 정량 비교와 재현 가능한 성능 검증에 이점이 존재한다. 그러나 공용 벤치마크 데이터 세트만으로는 최근 서비스로 제공되거나 공개적으로 활용되는 딥보이스 플랫폼에서 생성되는 음성의 특성을 충분히 반영하기 어려울 가능성이 존재한다. 이에 따라 본 연구는 2025년 시점에 새로 개발된 또는 사용량이 많은 상용 딥보이스 플랫폼에서 생성된 음성에 대해 모델의 일반화 가능성을 평가하는 것에 초점을 두었다. 이를 위해 공개된 데이터와 함께 VALL-E X, tortoise, ElevenLabs, Fish Audio, Supertone, Clony AI 등 다양한 공개 및 상용 딥보이스 플랫폼을 반영하여 별도의 데이터 세트를 구성하였다. 또한, 특정 화자에 대한 종속성을 최소화하기 위해 학습과 평가 단계에서 화자를 완전히 분리하였으며, 음성 길이를 1초, 1.5초, 2초의 구간으로 분할하여 짧은 발화에서도 탐지가 가능한 실용성을 평가하였다. 이를 통해 불특정 다수의 화자를 대상으로 짧은 음성만으로도 딥보이스 여부를 판별할 수 있어, 디지털 포렌식 수사 환경에서의 실제 적용 가능성을 기대한다.
본 논문의 구성은 다음과 같다. 2장에서는 딥보이스 탐지에 관한 관련 연구를 서술한다. 3장에서는 본 논문에 대한 배경지식을 설명한다. 4장에서는 연구 방법론으로 실험 조건, 데이터 세트 수집 및 생성 과정 그리고 데이터 전처리에 관하여 서술한다. 5장은 실험 결과와 기존 연구와의 비교를 보여주며, 6장에서는 본 실험의 결론 및 향후 연구로 마무리한다.
II. 관련연구
딥보이스 탐지에 관한 연구는 지속적으로 이루어지고 있다. 강구현 외 1인은 CNN-LSTM 모델을 기반으로 딥보이스 탐지 연구를 진행하였다. 학습 데이터 세트로 AI-HUB에서 제공한 감정이 태깅된 자유 대화를 사용하였다. 딥러닝 모델로는 CNN-LSTM 모델을 사용하였으며, 검증에서는 99.63%의 정확도를 기록하였다. 하지만, 유튜브 등에서 녹음한 평가 데이터 세트에 대해서는 58.76%의 정확도를 기록하였다[5]. 이는 인공지능 학습을 위해 가공된 데이터와 잡음, 패킷 손실 등 실제 환경에서 다루는 데이터 사이에 괴리가 있음을 의미한다. Kan Li 외 4인은 음성 특징 추출 기법과 딥러닝 모델을 이용해 딥보이스 탐지시스템을 개발하였다. 데이터 세트로는 ADD 2023 대회 Track 2에서 제공하는 딥보이스를 사용하였다. 딥러닝 모델로는 CNN 기반 VGG와 BiGRU를 결합한 CRNN 구조로, 79.5%의 평가 정확도를 기록하였다[6]. 한승우 외 4인은 음성 특성 추출 기술과 딥러닝 모델을 이용해 딥보이스 탐지시스템을 개발하였다. 데이터 세트로는 AI-HUB에서 제공하는 음성과 Tacotron2 딥보이스 생성 모델로 제작한 음성을 사용하였다. 딥러닝 모델로는 CNN-VGG 19와 BiLSTM 모델을 앙상블하여 성능을 측정하였고, 92.27%의 평가 정확도를 기록하였다[7]. 기존 연구에서는 CNN과 RNN 기반 모델을 주로 사용하였다. 하지만, CNN과 RNN 기반 모델은 모델 자체의 한계점이 존재한다. CNN 모델은 지역적 특징 학습에 뛰어나지만, 이미지의 전체적인 문맥을 포착하는 부분에 한계점이 존재한다. RNN 모델은 순차적인 정보에 대해 학습이 가능하지만, 장기 의존성 문제, 기울기 소실 및 폭발 문제 그리고 병렬처리가 불가능한 한계점이 존재한다.
CNN 모델과 RNN 모델의 한계점을 극복하기 위해 트랜스포머 구조가 주목받고 있다. 트랜스포머 구조는 셀프 어텐션(Self-Attention)을 활용하여 입력 시퀀스 내 모든 위치 간 관계를 동시에 학습하여 기존 모델들의 한계점을 극복한다. 특히, 트랜스포머를 기반으로 한 ViT 모델은 이미지를 일종의 시퀀스 데이터로 전처리하여 트랜스포머 구조를 적용함으로써 좋은 성능을 보였다. ViT 모델을 비롯한 트랜스포머 기반의 이미지 처리 모델은 본래 이미지 처리를 위해 개발되었으나, 최근 음성 신호 처리 및 분석 분야에서도 우수한 성능을 보여주고 있다. 해당 트랜스포머 기반의 이미지 처리 모델들로 딥보이스를 탐지하는 연구는 끊임없이 이어지고 있다. 신현서 외 5인은 Conformer 기반의 딥보이스 탐지 시스템인 HM-Conformer를 제안하였다. 해당 모델은 트랜스포머 구조와 CNN 모델의 구조를 결합한 구조이다. ASVspoof 2021 DF 데이터 세트를 사용하여 실험을 진행하였고, 실험 결과15.71%의 EER(Equal Error Rate)을 기록하였다[8]. YangXiao 외 1인은 XLSR-Mamba 모델을 제안하였다. 해당 모델은 Dual-Column Bidirectional Mamba 아키텍처를 기반으로 설계되었다[9]. Qishan Zhang 외 2인은 XLS-R 기반의 트랜스포머 모델을 활용하여 딥보이스를 탐지하는 연구를 진행하였다. 데이터 세트는 ASVspoof 2021DF를 활용하였으며, 원본 음성을 4초 단위로 자르거나 붙이는 전처리 과정을 수행하였다. 실험 결과1.92%의 EER 수치를 보였다[10].
III. 배경지식
3.1 MFCC
본 양식을 사용할 경우에는 제공된 스타일을 이용하여 작성하는 것이 가장 바람직하다. 이때 I.은 개요 1에 해당되며, 1.1은 개요 2, 1.1.1은 개요 3, 1.1.1.1은 개요 4에 해당된다. 개요 2부터는 문단번호 모양을 선택한 다음 새 번호 목록 시작을 이용하여 해당 장 번호를 사용하고 그 다음부터는 앞 번호 목록에 이어를 사용하면 된다.

Fig. 1. Process of MFCC Features Extraction
3.2 Vision Transformer
ViT 모델은 자연어 처리 분야에서 우수한 성능을 보인 트랜스포머 구조를 컴퓨터 비전 분야로 확장한 모델이다. ViT 모델은 입력 이미지를 P*P 패치(예 16x16)로 분할하여 평탄화를 수행한 후, 각 패치를 N차원 벡터로 선형 투영하여 시퀀스를 구성한다. 시퀀스의 앞부분에 클래스 토큰(Class Token)을 추가해 이미지를 대표하도록 학습하며, 각 패치 벡터에는 (1-N)의 위치 임베딩을 추가해 위치 정보를 보존한다. 이와 같이 구성된 시퀀스는 트랜스포머 인코더에 입력된다. 트랜스포머 인코더는 동일한 구조의 블록을 L번 반복하여 구성되며, L은 인코더의 깊이를 의미한다. 각 블록은 입력 시퀀스에 대한 계층 정규화(Layer Normalization), MSA(Multi-Head Self-Attention) 연산과 MLP(Multi Layer Perceptron)로 이루어져있다. 인코더 블록이 L번 반복된 후, 최종 출력을 MLP Head에 통과시켜 이미지 분류를 진행하는 것이 ViT 모델의 전체 구조이다. 이러한 ViT 모델은 CNN 모델에 비해 이미지에 특화된 유도 편향(Inductive bias)이 적다. 하지만, 셀프 어텐션을 통해 CNN 모델이 갖는 지역 커널 제약을 해소하였고, 전역적으로 상호작용을 학습할 수 있었으며, 이를 통해 이미지 분류에서도 효과적임을 입증하였다.
3.3 Data-Efficient Image Transformer
DeiT 모델은 ViT 모델과 동일한 구조로 되어 있으나, 지식 증류(Knowledge Distillation) 방식을 활용하여 훨씬 적은 양의 컴퓨터 자원과 학습 데이터로 유사한 성능을 달성할 수 있도록 설계되었다[13]. 지식 증류 방식은 교사(teacher) 모델의 출력을 통해 학생(student) 모델을 지도 학습하여 작은 모델에서도 높은 일반화 성능을 달성할 수 있도록 한다.
기존에 제안된 지식 증류 방식은 클래스 토큰과 패치 토큰(patch token)을 사용한다. DeiT 모델은 기존 지식 증류 방식에 증류 토큰(distillation token)을 도입하여, 교사 모델과 더 유사한 출력을 재현할 수 있도록 하였다.
3.4 Swin Transformer
Swin Transformer 모델은 컴퓨터 비전을 위해 설계된 Transformer 기반 모델이다[14]. 기존 NLP용 Transformer는 고해상도 이미지 처리 시 계산 복잡도가 기하급수적으로 증가하는 문제가 있어, 이를 해결하기 위해 개발되었다. 주요 특징은 계층적 구조와 윈도우 기반 어텐션 메커니즘이다. 전체 이미지에 어텐션을 적용하는 대신, 작은 윈도우 단위로 나누어 처리한다. W-MSA (Window-basedMSA)는 고정된 윈도우 내에서 어텐션을 수행하고, SW-MSA (Shifted Window-based MSA)는 윈도우 위치를 이동시켜 서로 다른 윈도우 간 정보 교환을 가능하게 한다. 이러한 설계를 통해 이미지 크기에 선형적으로 비례하는 계산 복잡도를 달성하여, 고해상도 이미지에서도 효율적인 특징 추출이 가능하다.
3.5 MambaOut
MambaOut 모델은 Mamba 모델에서 상태 공간 모델(State Space Model)을 제거한 이미지 처리 모델이다[15]. Mamba 모델은 트랜스포머 계열의 모델이 긴 시퀀스를 처리하기 어려운 문제를 해결하기 위해 등장한 모델로, 이를 해결하기 위해 상태 공간 모델을 도입하였다. 상태 공간 모델은 RNN 모델과 유사하게 이전 상태를 반영하는 특성이 존재한다. RNN 모델과의 차이점은 시퀀스 길이와 관계없이 이전 상태와 현재 입력을 병합하는 복잡성이 일정하게 유지되어 긴 시퀀스를 처리하는 것에 유리하다. 특히, Vision Mamba 모델은 도메인을 이미지로 변경하여 Mamba 구조에서 이미지 처리가 가능하도록 하였다[16]. 실제로 ImageNet 데이터 세트의 이미지 분류 작업에서 상태 공간 모델이 포함된 Vision Mamba 모델보다 MambaOut 모델이 더 높은 성능을 달성하였다.
3.6 성능 지표
딥러닝 모델의 대표적인 성능 지표로는 정확도(Accuracy), 정밀도(Precision), 재현율(Recall),F1-Score, FAR (False Acceptance Rate), FRR (False Rejection Rate) 그리고 EER(Equal Error Rate) 이 존재한다. 이 중 EER을 제외한 지표들은 혼동 행렬을 기반으로 계산할 수 있으며, EER은 FAR과 FRR이 동일해지는 지점에서의 오류율을 통해 계산할 수 있으며, 이는 정확도와 반대로 값이 낮을수록 높은 성능을 의미한다[17]. 혼동 행렬은 다음 Table 1.과 같으며, 각 지표의 계산 방식은 다음 수식과 같다.
Table 1. Confusion Matrix

\(\begin{align}\text {Accuracy} = \frac{T P + T N}{T P + T N + F P + F N}\end{align}\)
\(\begin{align}\text {Recall} = \frac{T P}{T P + F N}\end{align}\)
\(\begin{align}\text {F1-score}= \frac{ 2\times \text {Precision} \times {\text {Recall}}}{\text {Precision + Recall}}\end{align}\)
\(\begin{align}\text {Precision} = \frac{T P }{T P + F P}\end{align}\)
\(\begin{align}\text {FAR} = \frac{F P }{F P + T N} \end{align}\)
\(\begin{align}\text {FRR} = \frac{F N }{F N + T P} \end{align}\)
\(\begin{align}\text {EER} = \frac{F A R + F R R}{2} \end{align}\), where mint abs(FARt - FRRt)
IV. 실험 환경 구축
본 논문에서는 2가지의 실험 방법을 설정하여 실험을 진행한다. 첫 번째는 학습 및 평가를 진행하는 모델별 성능 측정을 하는 방식이며, 두 번째는 해당 모델에 대해서 음성파일의 길이를 변경하며 실험을 진행하는 방식이다. 기존 연구에서는 2초 이상 음성데이터를 탐지하는 연구가 주된 연구였다. 본 연구에서는 더 적은 시간에서 딥보이스 탐지 가능성을 확인하기 위해 기존 연구 시간인 2초를 기준으로 시간을 줄이며 학습 결과를 수행한다.
실험에 사용된 모델은 ViT, DeiT, Swin Transformer 그리고 MambaOut으로 총 4가지이며, 음성파일의 길이는 2초, 1.5초 그리고 1초로 총 3가지를 다룬다. 각 모델의 하이퍼파라미터(Hyperparameter)는 동일한 값으로 고정하였으며, 하이퍼파라미터에 대한 상세한 내용은 5장 딥보이스 탐지 실험에서 논의한다. 모델에 대한 평가는 이진 분류로 진행한다. 본 논문에서 진행하는 실험 과정은 Fig.2.와 같으며, 학습을 위한 데이터 세트 설명 및 데이터 전처리 과정은 다음과 같다.

Fig. 2. Flow of DeepVoice Detection
4.1 데이터 세트
본 논문에서는 딥보이스 탐지 실험을 위해 다양한 음성 데이터 세트를 수집 및 생성하였다. 수집한 데이터 세트는 Kaggle의 DEEP-VOICE: Deep Fake Voice Recognition 데이터 세트이다[18]. 생성한 데이터 세트는 딥보이스 생성 모델과 플랫폼을 통해 직접 생성하였다. 딥보이스 생성 모델인 VALL-E X[19]와 tortoise[20] 모델을 이용하였으며, 보이스 클로닝 기능을 지원하는 최신 플랫폼을 선정하였다. 선정한 플랫폼은 Windows 환경에서 ElevenLabs[21], Fish Audio[22] 그리고 Supertone[23] 플랫폼이며, Android 환경에서는 Clony AI[24] 플랫폼을 사용하여 자체적으로 딥보이스 데이터를 생성하였다. 또한, 특정 화자의 음성에 모델이 종속되는 현상을 막기 위해 다양한 화자로 구성된 딥보이스 데이터를 생성하였다. 이때 특정 생성 플랫폼 또는 생성 방식의 특성이 데이터 세트에 과도하게 반영되지 않도록, 각 생성 모델 및 플랫폼 별 데이터 수는 동일한 비율로 구성하였다. 데이터 세트는 학습, 검증, 평가용으로 6:2:2 비율로 나누어 학습 및 검증을 진행하였다. 이때 화자 의존성 문제를 해결하고자 평가 데이터 세트는 학습 및 검증 과정에 포함되지 않은 화자로만 구성하였다. 전체적인 데이터 세트에 포함된 음성파일의 샘플 수는 Table 2.와 같다.
Table 2. Total Dataset of Each Time

4.2 데이터 전처리
실제 환경에서 수집된 음성파일은 화자의 목소리 외에도 다양한 배경 소음을 포함하고 있으며, 이는 모델의 학습 및 평가에 영향을 줄 수 있다. 이에 따라, 본 실험에서는 배경 소음 제거 및 유효 발화 구간 선별을 통해 음성파일을 전처리하였다. 음성파일을 필터링하기 위해 소음 제거 모델을 적용하였으며, 화자 목소리와 주변 소음을 분리하기 위해 소음 제거 모델인 UVR5 (ULTIMATE VOCAL REM OVER 5) 애플리케이션 내 MB-Roformer-inst Voc-Duality-v2 모델을 사용하였다[25]. 해당 모델은 음원 분리 용도로 개발되었으나, 복합적인 음향 성분을 효과적으로 분리할 수 있어 음성 데이터 전처리 과정에서도 유의미한 결과를 보여준다.
소음 제거가 완료된 음성파일을 각각 2초, 1.5초 그리고 1초 단위로 분할하여 학습 및 검증에 사용하였다. 그러나 일정 길이로 분할된 음성파일 중 일부는 실제 발화가 없거나 매우 짧은 발화만 포함될 수 있다. 이는 학습에 부정적인 영향을 미칠 수 있다. 이러한 문제를 해결하기 위해 VAD (Voice Activity Detection)를 적용하여 유효 발화가 포함된 음성을 선별하였다. VAD는 음성 신호에서 발화 존재 여부를 탐지하는 기술로, 잡음 감소, 특징 추출, 임계값 기반 분류 등의 과정을 통해 발화를 판별한다[26]. 본 실험에서는 VAD 필터링 기준값을 0.5로 설정하여, 전체 음성파일 길이에서 발화가 50% 미만인 파일의 경우 학습 및 평가 데이터 세트에서 제거하였다. 선별된 유효 발화에 대해서는 프레임 단위로 MFCC 13계수 특징을 추출하였다. MFCC 13계수는 개별 프레임 기준으로 비교적 저차원 특징이지만, 시간 축으로 특징이 누적될 경우 음성의 시간적·주파수적 변화를 반영할 수 있는 시계열 데이터로 구성된다. 샘플링 레이트(sampling rate)는 16kHz로 설정하였으며, 프레임(frame) 길이와 홉(hop) 길이는 각각 25ms와 10ms로 설정하여 초당 100개의 프레임을 생성하였다. 이에 따라 2초, 1.5초, 1초의 음성 길이에서 음성 파일 하나에 대해 각각 2,600개, 1,950개, 1,300개의 특징을 추출하였다. 추출된 MFCC 특징은 순서 정보를 보존하기 위해 높이가 13인 1채널 이미지 형태로 변환하였다. 따라서, 본 논문에서 다루는 모델은 높이와 너비가 224인 이미지를 입력으로 받는다. 입력 데이터의 형식을 맞추기 위해 음성 파일에서 추출한 특징으로 생성한 이미지에 양선형 보간법(BilinearInterpolation)을 적용하였다. 음성파일에서 추출된 MFCC 계수와 보간법이 적용된 결과 예시는 Fig. 3.과 같다.

Fig. 3. Data Preprocessing Steps
V. 딥보이스 탐지 실험
본 실험에서는 timm 라이브러리[27]에서 제공하는 사전 학습된 트랜스포머 기반의 이미지 처리 모델을 사용하였다. 사용한 모델은 ViT, DeiT, Swin Transformer와 MambaOut의 base 모델이다. 해당 모델들은 학습 데이터 세트를 통해 파인튜닝(finetuning) 되었으며, 파인튜닝 과정에서 모두 동일한 하이퍼파라미터가 사용되었다. 각 하이퍼파라미터에서 배치 크기(batch size)는 128로 설정하였고, 학습률(learning rate)은 3e-5, 가중치 감쇠(Weight Decay)는 3e-5, 옵티마이저(optimizer)는 AdamW 그리고 손실함수는 교차 엔트로피(CrossEntropyLoss)를 사용하였다. 실험 환경은 Table 3.과 같다.
Table 3. Experimental Environment of Study

5.1 Vision Transformer
ViT 모델의 실험 결과로, 1초의 음성파일을 학습 및 평가를 진행했을 때 가장 우수한 성능을 보였다. 88.31%의 정확도, 88.75%의 정밀도, 88.69%의 재현율, 88.59%의 F1-Score 그리고 12.41%의 EER로 결괏값이 나타났다. 나머지 1.5초의 음성파일의 경우 17.85%의 EER, 2초는 16.16%의 EER을 보이며 준수한 성능을 보였다. 학습한 시간에 따른 성능을 비교 분석한 결과는 Table 4.와 같다.
Table 4. Evaluation metrics of the ViT model by voice time

5.2 Data-Efficient Image Transformers
DeiT 모델의 실험 결과로, 1.5초의 음성파일을 학습 및 평가를 진행했을 때 가장 우수한 성능을 보였다. 88.78%의 정확도, 89.49%의 정밀도, 88.59%의 재현율, 88.9%의 F1-Score 그리고 12.6%의 EER로 결괏값이 나타났다. 나머지 1초의 음성파일의 경우 16.92%의 EER, 2초는 17.07%의 EER을 보이며 준수한 성능을 보였다. 학습한 시간에 따른 성능을 비교 분석한 결과는 Table 5.와 같다.
Table 5. Evaluation metrics of the DeiT model by voice time

5.3 Swin Transformer
Swin Transformer 모델의 실험 결과로, 2초의 음성파일을 학습 및 평가를 진행했을 때 가장 우수한 성능을 보였다. 95.7%의 정확도, 95.75%의 정밀도, 95.26%의 재현율, 95.5%의 F1-Score 그리고 4.54%의 EER로 결괏값이 나타났다. 나머지 1초의 음성파일의 경우 6.33%의 EER, 1.5초는 4.77%의 EER을 보이며 준수한 성능을 보였다. 학습한 시간에 따른 성능을 비교 분석한 결과는 Table 6과 같다.
Table 6. Evaluation metrics of the Swin Transformer model by voice time

5.4 MambaOut
MambaOut 모델의 실험 결과로, 1.5초의 음성 파일을 학습 및 평가를 진행했을 때 가장 우수한 성능을 보였다. 89.17%의 정확도, 91.77%의 정밀도, 88.74%의 재현율, 89.51%의 F1-Score 그리고 6.81%의 EER로 결괏값이 나타났다. 나머지 1초의 음성파일의 경우 12.39%의 EER, 2초는 6.09%의 EER을 보이며 준수한 성능을 보였다. 학습한 시간에 따른 성능을 비교 분석한 결과는 Table 7.과 같다.
Table 7. Evaluation metrics of the MambaOut model by voice time

5.5 실험 결과 및 기존 연구와의 비교
실험 결과, 전반적으로 검증 및 평가 성능 차이가 존재하며 이는 학습과 평가에 화자를 분리해서 진행하였기에 발생하는 결과이다. 그럼에도 성능평가에서 모든 모델이 16% 이하의 EER과 86% 이상의 F1-Score로 준수한 성능을 보인다. 딥보이스 탐지 모델에 따른 성능을 비교하기 위해 실험 결과를 확인하였다. 실험을 진행한 모델인 ViT, DeiT, Swin Transformer, MambaOut에서 각각 1초, 1.5초, 2초 그리고 1.5초인 경우에 가장 좋은 성능을 보였다. 특히 ViT, DeiT, MambaOut 모델에 대해서는 2초보다 더 적은 시간을 학습하였을 때 오히려 우수한 성능을 나타내었다. 이는 딥보이스의 실시간 탐지에 유리하며, 실제 딥보이스 악용 사례에 효과적으로 대응할 수 있음을 시사한다. 반면, Swin Transformer 모델의 경우 음성파일의 길이가 2초일 때 4.54%의 EER과 95.5%의 F1-Score로 가장 우수한 성능을 보였다. 각 모델의 가장 우수한 성능을 비교 분석한 표는 Table 8.과 같다.
Table 8. Summary of Each Model’s Best Performances

가장 우수한 성능을 보인 2초 길이에서의 Swin Transformer와 기존 연구와의 비교를 진행하였다. 실험 결과는 Table 9.와 같다. 비교 대상은 CNN-LSTM[5], CRNN[6], HM-Conformer[8], XLSR-Mamba[9] 그리고 XLS-R & SLS[10]이다. 일부 모델은 공개된 사전 학습모델이 존재하지 않아 우선 공개된 사전 학습모델과 비교하였다. 이후, 전체 모델을 본 연구의 데이터 세트로 재학습하여 비교하였다. 이에 따라 비교 결과의 이해를 돕기 위해 공개된 사전학습 모델의 경우를 (A), 본 연구와 동일한 데이터 세트를 재학습한 경우를 (B) 그리고 Swin Transformer를 (C)로 구분하였다.
Table 9. Comparison with previous studies on 2 second

비교 결과, 사전학습 모델의 경우 기존 연구에서 제시한 성능보다 낮아짐을 확인하였다. 동일 조건에 재학습한 경우, 대부분 모델에서 성능 향상이 확인되었다. 이는 기존 모델에 학습에 사용되지 않은 최신 모델이 포함되어 성능에 영향을 준 것으로 추정된다.
VI. 결론
본 논문에서는 딥보이스 탐지에 있어 기존 연구가 가진 특정 딥보이스 생성 모델 종속으로 인한 일반화 성능 부족, 화자 종속성 문제를 해결하고자 트랜스포머 기반 모델인 ViT, DeiT와 Swin Transformer 그리고 MambaOut 모델을 활용하여 탐지 성능을 비교 평가하였다. 이를 위해 다양한 딥보이스 생성 모델을 활용하여 데이터 세트를 구성하였다. 또한, 화자를 완전히 분리한 상태에서 학습 및 평가를 진행함으로써 모델의 강건성을 검증하였다. 데이터 전처리의 경우, 음성파일의 길이를 2초, 1.5초 그리고 1초로 하여 음성파일의 학습 시간에 따른 모델의 성능을 확인하여 짧은 음성으로도 탐지 가능성에 대해 평가하였다. 트랜스포머 모델의 차원과 정확한 학습을위해 음성파일의 프레임 단위로 MFCC 13계수를 추출한 이후 시퀀스 데이터를 이미지 형태로 변환하여 모델의 입력 형식에 맞추었다.
실험 결과, 모든 모델이 86% 이상의 F1-Score와 16% 이하의 EER을 기록하며 준수한 성능을 보였다. 특히, Swin Transformer는 2초의 음성파일에서 F1-Score 95.5%와 EER 4.54%로 실험을 진행한 모든 모델 중에서 가장 우수한 성능을 기록하였다. 또한, 1.5초의 음성파일에서도 F1-Score 95.31%와 EER 4.77%로, 음성 길이를 줄이더라도 성능 저하가 크지 않음을 확인하였다. 추가적으로, 기존 연구 모델과의 비교 실험에서도 본 연구의 유의미한 결과를 보였다. 동일한 데이터 세트와 전처리 조건에서 기존 연구 모델을 재학습하여 비교한 결과, Swin Transformer 모델이 가장 우수한 성능을 보였다. 이러한 결과는 2초 이하의 비교적 짧은 음성파일과 불특정 화자 조건에서도 Swin Transformer 모델이 안정적인 탐지가 가능함을 보여준다.
본 연구와 동일한 실험 설정 하에 기존 연구 모델과 비교한 결과, Swin Transformer가 우수한 성능을 보였다. 공개된 사전학습 모델을 본 연구의 평가 데이터 세트에 추가 학습 없이 적용한 경우에는 뚜렷한 성능 저하가 확인되었다. 그러나 본 연구의 데이터 세트로 재학습한 경우 대부분 모델이 성능 향상을 보였다. 이는 새로운 생성 모델 및 서비스 환경이 지속적으로 등장하는 상황에서 탐지 모델 역시 이에 대응할 수 있도록 지속적인 데이터 갱신과 재학습이 필요함을 시사한다. 본 연구에서 제안한 탐지 체계는 디지털 포렌식 수사 관점에서 불특정 화자를 대상으로 짧은 음성만으로도 딥보이스 여부를 판별할 수 있어, 실제 수사 환경에서의 적용 가능성을 기대한다.
향후 연구에서는 가장 우수한 성능을 보인 Swin Transformer 모델을 활용하여 탐지 성능을 더욱 발전시킬 계획이다. 더욱 짧은 구간 단위로 분할하고 이를 실시간으로 판별하는 방식을 고도화할 계획이다. 다만, 분할된 음성 구간별 판별은 장시간 음성데이터에서 오탐과 미탐이 누적되어 혼재될 가능성이 있으며, 개별 구간에서 높은 정확도를 보이더라도 전체 음성에 대한 신뢰가 높은 것으로 직결되지 않을 수 있다. 이에 따라, 분할 구간별 탐지 결과를 누적 및 통합하여 장시간 음성 전체에 대한 최종 판단을 수행할 계획이다. 이를 통해 디지털 수사 환경에서 실시간 딥보이스 탐지 모델로써의 활용 가능성을 높일 계획이다.
References
- Wikipedia, "Speech synthesis," https://en.wikipedia.org/wiki/Speech_synthesis, Dec. 2025.
- S. O. Arik, M. Chrzanowski, A. Coates, G. Diamos, A. Gibiansky, Y. Kang, X. Li, J. Miller, A. Ng, J. Raiman, S. Sengupta, and M. Shoeybi, "Deep Voice: Real-time Neural Text-to-Speech," Proceedings of the 34th International Conference on Machine Learning, vol. 70, pp. 195-204, Jul. 2017.
- "Namyangju AI Exploitation 'Deep Voice' Voice Phishing... Urgent Alert Needed," Gyeonggi Daily, Aug. 29, 2024.
- "Deepfake Voice Impersonation··· US FBI Warns of New Voice Phishing," Digital Today, May 2025.
- Guhyeon Kang and Minhae Kwon, "CNN-LSTM model Based Deep Voice Detection," Proceedings of Symposium of the Korean Institute of Communications and Information Sciences, (Jeju,) pp. 1270-1271, Jun. 2024.
- Kang Li, Xiao-min Zeng, Jian-tao Zhang, and Yan Song, "Convolutional Recurrent Neural Network and Multitask Learning for Manipulation Region Location," Proceedings of IJCAI 2023 Workshop on Deepfake Audio Detection and Analysis, pp. 18-22, Aug. 2023.
- Seung-woo Han, Seong-hun Han, Seong-min You, Dong-ho Song, and Chang-jin Seo, "A Study on the Development of Deep Learning-Based Deep Voice Detection System Using Mel-Spectrogram and MFCC," The Transactions of the Korean Institute of Electrical Engineers, 72(3), pp. 186-192, Sep. 2023.
- Hyun-seo Shin, Jungwoo Heo, Ju-ho Kim, Chang-yeong Lim, Wonbin Kim, and Ha-jin Yu, "Hm-conformer: A conformer-based audio deepfake detection system with hierarchical pooling and multi-level classification to ken aggregation methods," ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 10581-10585, Apr. 2024.
- Yang Xiao and Rohan Kumar Das, "XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack Detection," IEEE Signal Processing Letters, vol. 32, pp. 1276-1280, Mar. 2025. https://doi.org/10.1109/LSP.2025.3547861
- Qishan Zhang, Shuangbing Wen, and Tao Hu, "Audio deepfake detection with self-supervised xls-r and sls classifier," Proceedings of the 32nd ACM International Conference on Multimedia, pp. 6765-6773, Oct. 2024.
- Wikipedia, "Mel-frequency cepstrum," https://en.wikipedia.org/wiki/Mel-frequency_cepstrum, Dec. 2025.
- S. Davis and P. Mermelstein, "Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences," IEEE Transactions on Acoustics, Speech, and Signal Processing, vol. 28, no. 4, pp. 357-366, Aug. 1980. https://doi.org/10.1109/TASSP.1980.1163420
- Hugo Touvron, Matthieu Cord, Matthijs Douze, Francisco Massa, Alexandre Sablayrolles, and Herve Jegou, "Training data-efficient image transformers & distillation through attention," Proceedings of the International Conference on Machine Learning, pp. 10347-10357, Jul. 2021.
- Ze Liu, Yutong Lin, Yue Cao, Han Hu, Yixuan Wei, Zheng Zhang, Stephen Lin, and Baining Guo, "Swin Transformer: Hierarchical Vision Transformer Using Shifted Windows," Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pp. 10012-10022, Oct. 2021.
- Weihao Yu and Xinchao Wang, "MambaOut: Do We Really Need Mamba for Vision?," Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR), (Nashville,) pp. 4484-4496, Jun. 2025.
- Lianghui Zhu, Bencheng Liao, Qian Zhang, Xinlong Wang, Wenyu Liu, and Xinggang Wang, "Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model," Proceedings of the 41st International Conference on Machine Learning, pp. 62429-62442, Jul. 2024.
- Lightning AI, "Expected Error Rate," https://lightning.ai/docs/torchmetrics/stable/classification/eer.html, Dec. 2025.
- Kaggle, "DEEP-VOICE: DeepFake Voice Recognition," https://www.kaggle.com/datasets/birdy654/deep-voice-deepfake-voice-recognition/data, Dec. 2025.
- GitHub, "VALL-E X: Multilingual Text-to-Speech Synthesis and Voice Cloning," https://github.com/Plachtaa/VALL-E-X, Dec. 2025.
- GitHub, "TorToiSe," https://github.com/neonbjb/tortoise-tts, Dec. 2025.
- ElevenLabs, "The most realistic voice AI platform," https://elevenlabs.io, Dec. 2025.
- Hanbi AI Inc, "The most realistic AI Speech," https://fish.audio, Dec. 2025.
- Supertone, "Next Level of Text-to-speech," https://www.supertone.ai, Dec. 2025.
- Clony AI, "Clone your friends voices & faces," https://clony.app, Dec. 2025.
- GitHub, "Ultimate Vocal Remover GUI v5.6," https://github.com/Anjok07/ultimatevocalremovergui, Dec. 2025.
- Wikipedia, "Voice activity detection," https://en.wikipedia.org/wiki/Voice_activity_detection, Dec. 2025.
- GitHub, "PyTorch Image Models," https://github.com/huggingface/pytorch-image-models, Dec. 2025.