• Title/Summary/Keyword: 음성추출

Search Result 988, Processing Time 0.026 seconds

Speaker Identification Using Higher-Order Statistics In Noisy Environment (고차 통계를 이용한 잡음 환경에서의 화자식별)

  • Shin, Tae-Young;Kim, Gi-Sung;Kwon, Young-Uk;Kim, Hyung-Soon
    • The Journal of the Acoustical Society of Korea
    • /
    • v.16 no.6
    • /
    • pp.25-35
    • /
    • 1997
  • Most of speech analysis methods developed up to date are based on second order statistics, and one of the biggest drawback of these methods is that they show dramatical performance degradation in noisy environments. On the contrary, the methods using higher order statistics(HOS), which has the property of suppressing Gaussian noise, enable robust feature extraction in noisy environments. In this paper we propose a text-independent speaker identification system using higher order statistics and compare its performance with that using the conventional second-order-statistics-based method in both white and colored noise environments. The proposed speaker identification system is based on the vector quantization approach, and employs HOS-based voiced/unvoiced detector in order to extract feature parameters for voiced speech only, which has non-Gaussian distribution and is known to contain most of speaker-specific characteristics. Experimental results using 50 speaker's database show that higher-order-statistics-based method gives a better identificaiton performance than the conventional second-order-statistics-based method in noisy environments.

  • PDF

Speech Spectrum Enhancement Combined with Frequency-weighted Spectrum Shaping Filter and Wiener Filter (주파수가중 스펙트럼성형필터와 위너필터를 결합한 음성 스펙트럼 강조)

  • Choi, Jae-Seung
    • Journal of the Korea Institute of Information and Communication Engineering
    • /
    • v.20 no.10
    • /
    • pp.1867-1872
    • /
    • 2016
  • In the area of digital signal processing, it is necessary to improve the quality of the speech signal after removing the background noise which exists in a various real environments. The important thing to consider when removing the background noise acoustically is that to solve the problem, depending on the information of the human auditory mechanism is mainly the amplitude spectrum of the speech signal. This paper introduces the characteristics of a frequency-weighted spectrum shaping filter for the extraction of the amplitude spectrum of the speech signal with the primary purpose. Therefore, this paper proposes an algorithm using the methods of a Wiener filter and the frequency-weighted spectrum shaping filter according to the acoustic model, after extracted the amplitude spectral information in the noisy speech signal. The spectral distortion (SD) output of the proposed algorithm is experimentally improved more than 5.28 dB compared to a conventional method.

Speech Recognition Performance Improvement using a convergence of GMM Phoneme Unit Parameter and Vocabulary Clustering (GMM 음소 단위 파라미터와 어휘 클러스터링을 융합한 음성 인식 성능 향상)

  • Oh, SangYeob
    • Journal of Convergence for Information Technology
    • /
    • v.10 no.8
    • /
    • pp.35-39
    • /
    • 2020
  • DNN error is small compared to the conventional speech recognition system, DNN is difficult to parallel training, often the amount of calculations, and requires a large amount of data obtained. In this paper, we generate a phoneme unit to estimate the GMM parameters with each phoneme model parameters from the GMM to solve the problem efficiently. And it suggests ways to improve performance through clustering for a specific vocabulary to effectively apply them. To this end, using three types of word speech database was to have a DB build vocabulary model, the noise processing to extract feature with Warner filters were used in the speech recognition experiments. Results using the proposed method showed a 97.9% recognition rate in speech recognition. In this paper, additional studies are needed to improve the problems of improved over fitting.

RoutingConvNet: A Light-weight Speech Emotion Recognition Model Based on Bidirectional MFCC (RoutingConvNet: 양방향 MFCC 기반 경량 음성감정인식 모델)

  • Hyun Taek Lim;Soo Hyung Kim;Guee Sang Lee;Hyung Jeong Yang
    • Smart Media Journal
    • /
    • v.12 no.5
    • /
    • pp.28-35
    • /
    • 2023
  • In this study, we propose a new light-weight model RoutingConvNet with fewer parameters to improve the applicability and practicality of speech emotion recognition. To reduce the number of learnable parameters, the proposed model connects bidirectional MFCCs on a channel-by-channel basis to learn long-term emotion dependence and extract contextual features. A light-weight deep CNN is constructed for low-level feature extraction, and self-attention is used to obtain information about channel and spatial signals in speech signals. In addition, we apply dynamic routing to improve the accuracy and construct a model that is robust to feature variations. The proposed model shows parameter reduction and accuracy improvement in the overall experiments of speech emotion datasets (EMO-DB, RAVDESS, and IEMOCAP), achieving 87.86%, 83.44%, and 66.06% accuracy respectively with about 156,000 parameters. In this study, we proposed a metric to calculate the trade-off between the number of parameters and accuracy for performance evaluation against light-weight.

Implementation of MPEG4-CELP Vocoder for Speech Codec of Internet Video Phone (인터넷 화상 전화용 음성 코텍을 위한 MPEG4-CELP 부호화기의 구현)

  • 김병수;김동형;강경옥;홍진우;정재호
    • Proceedings of the IEEK Conference
    • /
    • 2000.09a
    • /
    • pp.119-122
    • /
    • 2000
  • 인터넷이 일상생활에 다양하게 활용되면서 인터넷 채널을 통한 정보의 형태는 문자와 이미지 외에 음성, 오디오 신호 및 동영상 부분까지 확대되고 있다. 본 논문에서는 MPEG4-CELP를 인터넷 화상 통신의 음성 코덱용으로 사용하기 위한 최적화 기법 및 알고리듬의 개선을, DSP칩이 내장된 보드가 아닌 인터넷의 터미널로 사용되고 있는 펜티엄 프로세서를 장착한 PC에 초점을 맞추어 수행하였다. MPEG4-CELP VM C소스를 분석 및 프로파일(Profile)한 결과를 토대로 패라미터 추출을 위해 많은 연산을 수행하는 부호화기에 대해서 CPU상에 부하를 많이 주는 함수들을 제 1차 최적화 대상 함수들로 선정하고, CPU에 부하를 많이 주지는 않으나 호출되는 회수가 많은 함수를 2차 최적화 대상 함수로 선정해, C소스 레벨의 소프트웨어 파이프 라이닝(Software Pipelinging) 기법들을 적용하여 최적화를 수행하였다. 또한 1차 최적화 대상 함수의 경우에는 소프트웨어 파이프라이닝의 적용과 함께 연산량 감소를 위한 알고리듬 변형까지 수행하였다. 위의 과정을 거쳐 최적화 된 MPEG4-CELP는 펜티엄Ⅲ 450㎒ PC에서 음성을 부호화 하는데 원 VM소스에 비해 약 2배정도의 시간이 단축되는 것을 확인하였다.

  • PDF

Processing of Morphological Transformation for Korean Continuous Speech Recognition (한국어 연속음성 인식을 위한 형태론적 변형 처리)

  • 정경석;박혁로
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2003.04c
    • /
    • pp.489-491
    • /
    • 2003
  • 한국어는 형태론적 변형 현상이 자주 일어나게 되어 최종적으로 음성인식의 성능에 졸지 않은 영향을 끼친다. 본 논문에서는 연속음성 인식의 성능 개선을 위해 형태론적 변형을 처리하는 방법을 제시하고 짧은 형태소를 결합하여 의사형태소를 추출하고자 한다. 이 방법은 음성인식의 성능 개선을 위하여 품사세트와 사전을 다시 정의하고 텍스트 정규화를 수행한다. 그리고 불규칙 용언 처리의 규칙을 작성하고 나머지 형태론적 변형현상은 에러 패턴을 분석하여 빈출 어휘 중심 및 다단계로 규칙 처리하였다. 마지막으로, 단음절 형태소들을 결합함으로써 최종적으로 원하는 의사형태소를 구할 수 있었다. 제안된 시스템은 오 인식률이 높은 단음절 형태소들을 결합하여 성능 향상이 기대됨은 물론, 형태론적 변형현상에서는. 9~10%의 높은 성능 향상을 가져올 수 있었다.

  • PDF

A Study on the Gain Table Optimazation for Real-Time Speech Codec (실시간 음성 부호화기 구현을 위한 이득테이블 조정에 관한 연구)

  • 김남시;이성권;강준길;김순협
    • The Journal of the Acoustical Society of Korea
    • /
    • v.17 no.7
    • /
    • pp.12-21
    • /
    • 1998
  • 본 논문은 음성 부호화기인 MPMLQ(Multi Pulse Maximum Likehood Quantization)를 고정 소숫점 범용 DSP에 실시간으로 구현할 때 발생되는 계산량을 줄이기 위한 변형된 형태의 MPMLQdp 관한 것이다. MPMLQ는 음성 신호에서 선형 예측 계수와 피치 정보를 추출하고 남은 잔여 신호와 가장 유사한 여기 신호를 표현할 때 상관법을 이용 한다. 상관법은 DSP상에 구현할 때 계수 승산 오버플로우를 발생시킬 수 있으므로 연산후 항상 점검하여야 한다. 이것은 MPMLQ 구현시 전체 계산량의 많은 부분을 차지한다. 본 논 문은 이러한 문제점에 착안하여 계수 승산 오버플로우가 발생하지 않도록 입력 음성신호의 크기를 2비트 만큼 줄이고, 이로 인하여 같은 크기로 줄어든 잔여 신호를 고려하여 MPMLQ에서 여기신호의 크기를 표현하는 고정 코드북 이득표를 적절히 조절하였다. 실험 결과 변형된 MPMLQ의 SSNR은 0.040325dB(실험data기준) 향상되었으며, 계산량에 있어서 도 17.7%의 처리속도 향상되었다. 따라서 고정 소숫점 범용 DSP에 실시간 구현이 가능하였다.

  • PDF

Implementation of Stock Information System and Methods for Efficient Use of System Resources (KT 증권정보 서비스 시스템의 구현과 시스템 자원의 효율적 활용을 위한 방법 고찰)

  • 박성준
    • Proceedings of the Acoustical Society of Korea Conference
    • /
    • 1998.06e
    • /
    • pp.323-326
    • /
    • 1998
  • 본 논문에서는 한국통신에서 음성인식을 이용한 전화정보 서비스의 일환으로 개발해 온 증권정보 시스템의 구조와 기능을 설명하고, 시스템을 다채널로 확장함에 있어서 시스템의 자원을 효율적으로 활용하기 위하여 적용한 방법에 대하여 기술하였다. 이 시스템에서는 음성특징을 추출하는 프로세서(DSP0)들과 단억검색을 하는 프로세서(DSP1)들이 분리되어 있으며, 이 둘 간의 개수 비율을 조절함으로써 실시간적 처리 효과를 유지하면서도 시스템의 전체 프로세서의 개수를 줄였다. DSP0와 DSP1 간의 음성 특징 데이터 전송에 있어서는 DSP0에서 발생하는 데이터를 음성이 입력되는 중에 전송할 수 있게 함으로써, DSP1에서는 DSP0과 병렬적으로 작업을 수행시킬 수 있으며, 결과적으로 시스템의 속도를 빠르게 하였다.

  • PDF

Pitch Detection by Synchronizing the Phase of Noise-Corrupted Speech Signals (위상 동기화에 의한 잡음 음성의 피치 검출)

  • 이병국;배명진;안수길
    • The Journal of the Acoustical Society of Korea
    • /
    • v.11 no.1E
    • /
    • pp.42-49
    • /
    • 1992
  • 시간 영역에서 음성의 피치 정보를 추출하는 새로운 알고리즘을 제안한다. 이 알고리즘은, 위상 이 일치하는 고조파 성분의 합은 위상이 일치하지 않는 고조파 성분의 합의 경우보다 주기 정보를 분명 히 나타낸다는 사실을 이용한 것이다. 즉, 음성 신호의 위상 성분을 0으로 되도록 하여 실질적으로 기본 파와 모든 고조파 성분의 위상을 일치시킨다. 이 알고리즘은 잡음이 없는 음성의 경우 0.18%의 조오류 를 보이며, 0dB 눅의 경우에도 3.63%의 조오류를 보임으로써 잡음에 강건한 성질이 있음을 알 수 있다. 또한 시간 영역에서의 결정 논리를 사용하므로 피치 해상도가 우수하다. 전반적인 실험결과는 제안된 알고리즘이 피치 검출에 상당히 효율적임을 나타낸다.

  • PDF

A Study of Continuous Speaker Recognition for Intelligent Responsive Space (지능형 반응공간을 위한 연속적 화자인식에 관한 연구)

  • Kwon, Soon-Il
    • 한국HCI학회:학술대회논문집
    • /
    • 2007.02a
    • /
    • pp.293-297
    • /
    • 2007
  • Human Computer Interaction 기술을 구체화 시키기 위한 Intelligent Responsive Space의 개발에 있어서 음성정보는 여러 가지로 유용하게 활용될 수 있다. 음성신호로부터 얻을 수 있는 다양한 정보 중의 하나가 화자인식을 이용한 화자의 신원식별이다. 이 논문에서는 화자인식 인식이 어려운 환경에서도 음성 신호로부터 추출한 특성벡터들을 선택적으로 사용함으로써 화자인식 성능을 높일 수 있는 새로운 방법을 제안하려 한다. 화자를 인식하는데 있어서 인식오류를 발생시킬 가능성이 높은 특성벡터들을 인식을 위한 판단의 대상에서 배제시킴으로써 성능을 향상시킬 수 있다. 실험결과에 의하면 0.25초에서2초 길이의 짧은 음성만으로도 기존의 방법에 비해 20에서 51%의 상대적 성능 향상을 보였다. 새롭게 제안된 방법을 적용하면 기존의 방법들에 비해 세밀하면서도 정확하게 연속적으로 화자들을 인식할 수 있게 된다.

  • PDF