• 제목/요약/키워드: Noisy Model

검색결과 344건 처리시간 0.025초

PCMM 기반 특징 보상 기법에서 변별력 향상을 위한 Minimum Classification Error 훈련의 적용 (Minimum Classification Error Training to Improve Discriminability of PCMM-Based Feature Compensation)

  • 김우일;고한석
    • 한국음향학회지
    • /
    • 제24권1호
    • /
    • pp.58-68
    • /
    • 2005
  • 본 논문에서는 잡음 환경에서 강인한 음성 인식을 위하여 특징 보상 기법의 성능을 향상시킬 수 있는 방법을 제안한다. 기존의 음성 모델 기반의 특징 보상 기법에서 이용되는 오염 음성 모델 추정 방식은 입력 음성에 대한 변별력 있는 사후 확률 예측을 보장하지 못하며, 부정확하게 계산된 사후 확률은 복구된 음성에서 명료도 하락의 문제를 일으킨다. 제안하는 기법에서는 오염 음성 모델 추정 과정에 분별적 훈련 방식의 하나인 최소 분류 오류 (MCE) 훈련 기법을 도입한다. MCE 훈련 기법을 적용하기 위해 변별력 하락의 가능성을 가지는 '경쟁 요소' 를 결정하는 기법을 제안한다. 병렬결합된 혼합 모델 (PCMM) 기반의 특징 보상에 MCE 훈련 기법을 적용하는 과정을 제안하고 변별력 향상의 영향을 관찰한다. Aurora 2.0 데이터베이스와 실제 자동차 주행 환경에서 수집된 음성 데이터베이스에 대한 성능 평가를 실시한다. 실험 결과는 제안한 기법이 음성 인식 성능 향상에 도움이 되는 것을 입증한다.

잡음 환경에 효과적인 음성인식을 위한 특징 보상 이득 기반의 음성 향상 기법 (Speech enhancement method based on feature compensation gain for effective speech recognition in noisy environments)

  • 배아라;김우일
    • 한국음향학회지
    • /
    • 제38권1호
    • /
    • pp.51-55
    • /
    • 2019
  • 본 논문에서는 잡음 환경에 강인한 음성 인식 성능을 위해 특징 보상 이득을 이용한 음성 향상 기법을 제안한다. 본 논문에서는 변분모델 생성 기법을 채용한 병렬 결합된 가우스 혼합 모델(Parallel Combined Gaussian Mixture Model, PCGMM) 기반의 특징 보상 기법으로부터 계산할 수 있는 특징 보상 이득을 이용하는 음성 향상 기술을 제안한다. 불일치 환경 음성 인식 시스템 적용 환경에서 본 논문에서 제안하는 기법이 실험 결과에서 기존의 전처리 기법 및 이전 연구에서 제안된 특징 보상 기반의 음성 향상 기법에 비해 다양한 잡음 및 SNR(Signal to Noise Ratio) 조건에서 월등한 인식 성능을 나타내는 것을 확인한다. 또한 잡음 모델 선택 기법을 적용함으로써 음성 인식 성능을 유사한 수준으로 유지하면서 계산량을 대폭적으로 감축할 수 있다.

신경망 기반 음성, 영상 및 문맥 통합 음성인식 (Speech Recognition by Integrating Audio, Visual and Contextual Features Based on Neural Networks)

  • 김명원;한문성;이순신;류정우
    • 전자공학회논문지CI
    • /
    • 제41권3호
    • /
    • pp.67-77
    • /
    • 2004
  • 최근 잡음환경에서 신뢰도 높은 음성인식을 위해 음성정보와 영상정보를 융합하는 방법이 활발히 연구되고 있다. 본 논문에서는 이절적인 정보의 융합에 적합한 신경망 모델을 기반으로 음성, 영상 및 문맥 정보 등 다양한 정보를 융합하여 잡음 환경에서 고려단어를 인식하는 음성인식 기법에 대하여 기술한다. 음성과 영상 특징을 이용한 이중 모드 신경망 BMNN(BiModal Neural Network)을 제안한다. BMM은 4개 층으로 이루어진 다층퍼셉트론의 구조를 가지며 각 층은 입력 특징의 추상화 기능을 수행한다. BMNN에서는 제 3층이 잡음에 의한 음성 정보의 손실을 보상하기 위하여 음성과 영상 특징을 통합하는 기능을 수행한다. 또한, 잡음환경에서 음성 인식률을 향상시키기 위해 사용자가 말한 단어들의 순차 패턴을 나타내는 문맥정보를 이용한 후처리 방법을 제안한다. 잡음환경에서 BMNN은 단순히 음성만을 사용한 것 보다 높은 성능을 보임으로써 그 타당성을 확인할 수 있을 뿐 아니라, 특히 문맥을 이용한 후처리를 하였을 경우 잡음 환경에서 90%이상의 인식률을 달성하였다 본 연구는 잡음환경에서 강인한 음성인식을 위해 다양한 추가 정보를 사용함으로써 성능을 향상시킬 수 있음을 제시한다.

Iterative LBG Clustering for SIMO Channel Identification

  • Daneshgaran, Fred;Laddomada, Massimiliano
    • Journal of Communications and Networks
    • /
    • 제5권2호
    • /
    • pp.157-166
    • /
    • 2003
  • This paper deals with the problem of channel identification for Single Input Multiple Output (SIMO) slow fading channels using clustering algorithms. Due to the intrinsic memory of the discrete-time model of the channel, over short observation periods, the received data vectors of the SIMO model are spread in clusters because of the AWGN noise. Each cluster is practically centered around the ideal channel output labels without noise and the noisy received vectors are distributed according to a multivariate Gaussian distribution. Starting from the Markov SIMO channel model, simultaneous maximum ikelihood estimation of the input vector and the channel coefficients reduce to one of obtaining the values of this pair that minimizes the sum of the Euclidean norms between the received and the estimated output vectors. Viterbi algorithm can be used for this purpose provided the trellis diagram of the Markov model can be labeled with the noiseless channel outputs. The problem of identification of the ideal channel outputs, which is the focus of this paper, is then equivalent to designing a Vector Quantizer (VQ) from a training set corresponding to the observed noisy channel outputs. The Linde-Buzo-Gray (LBG)-type clustering algorithms [1] could be used to obtain the noiseless channel output labels from the noisy received vectors. One problem with the use of such algorithms for blind time-varying channel identification is the codebook initialization. This paper looks at two critical issues with regards to the use of VQ for channel identification. The first has to deal with the applicability of this technique in general; we present theoretical results for the conditions under which the technique may be applicable. The second aims at overcoming the codebook initialization problem by proposing a novel approach which attempts to make the first phase of the channel estimation faster than the classical codebook initialization methods. Sample simulation results are provided confirming the effectiveness of the proposed initialization technique.

Optimized finite element model updating method for damage detection using limited sensor information

  • Cheng, L.;Xie, H.C.;Spencer, B.F. Jr.;Giles, R.K.
    • Smart Structures and Systems
    • /
    • 제5권6호
    • /
    • pp.681-697
    • /
    • 2009
  • Limited, noisy data in vibration testing is a hindrance to the development of structural damage detection. This paper presents a method for optimizing sensor placement and performing damage detection using finite element model updating. Sensitivity analysis of the modal flexibility matrix determines the optimal sensor locations for collecting information on structural damage. The optimal sensor locations require the instrumentation of only a limited number of degrees of freedom. Using noisy modal data from only these limited sensor locations, a method based on model updating and changes in the flexibility matrix successfully determines the location and severity of the imposed damage in numerical simulations. In addition, a steel cantilever beam experiment performed in the laboratory that considered the effects of model error and noise tested the validity of the method. The results show that the proposed approach effectively and robustly detects structural damage using limited, optimal sensor information.

잡음 환경에서의 음성인식을 위한 PMC 적응에 관한 연구 (A Study on the PMC Adaptation for Speech Recognition under Noisy Conditions)

  • 김현기
    • 한국산업정보학회논문지
    • /
    • 제7권3호
    • /
    • pp.9-14
    • /
    • 2002
  • 본 논문에서는 잡음 환경에서 음성 인식기의 성능을 향상시키기 위한 방법을 제안한다. 제안한 방법은 기존의 PMC방법으로 상태 당 가지 수가 많은 모델을 만들 때 발생하는 확률 밀도 분포의 변화를 보상하기 위해 상태 수준에서 조합한 파라미터를 재 추정하여 각 상태에서 가지의 확률 분포의 변화를 적응시키는 방법이다. 상태 당 다수의 가지를 가지는 CDHMM은 제안한 PMC 방법과 조합된다. 또한, EM 알고리즘은 가지 평균의 분산을 줄이기 위하여 모델 평균 파라미터를 적응시키는데 사용한다. 그리고 시뮬레이션을 통하여 본 논문에서 제안한 PMC 방법은 기존의PMC 방법보다 더 향상된 성능을 얻을 수 있었다.

  • PDF

온라인쇼핑몰 상품평 문법적 오류 개선을 위한 오피니언 마이닝에 대한 연구 (Research for the opinion mining for the improvement of online shopping mall review grammatical errors)

  • 박세정;황재승;김종배
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2015년도 춘계학술대회
    • /
    • pp.160-163
    • /
    • 2015
  • 현대인들은 필요한 물건들을 직접 구매하러 갈 시간이 부족하기 때문에 온라인 쇼핑몰의 이용 빈도가 늘어가고 있으며 이에 따라 온라인 쇼핑몰이 성행하고 있다. 하지만 온라인 쇼핑몰에서 물건을 구매하는 것은 물건을 눈으로 확인할 수 없다는 문제점이 있기 때문에 상품평은 구매를 결정하는데 많은 영향을 준다. 현재 온라인 쇼핑몰에서 고객이 상품평을 통해 상품에 대한 정보를 파악하기 어렵기 때문에 이를 해결하기 위한 연구들이 진행되고 있다. 이러한 연구들로 상품평의 의견을 분석하기 위한 연구로 오피니언 마이닝이 사용되고 있는 추세이다. 그러나 지금까지의 연구는 문법적인 오류, 신조어와 같이 국어사전에 등재되어 있지 않은 단어들을 감성분석기가 올바르게 판단하지 못하기 때문에 분석의 신뢰도가 떨어진다는 문제점이 있다. 그래서 형태소 분석을 실시하기 전에 신조어 사전을 추가하여 Noisy-channel model을 적용하여 더욱 정확한 감성분석이 가능하도록 하였다. 이러한 과정을 통해 가공된 정보를 바탕으로 상품평을 보다 정확하게 분석할 수 있는 시스템을 제안하고자 한다.

  • PDF

이중채널 잡음음성인식을 위한 공간정보를 이용한 통계모델 기반 음성구간 검출 (Statistical Model-Based Voice Activity Detection Using Spatial Cues for Dual-Channel Noisy Speech Recognition)

  • 신민화;박지훈;김홍국;이연우;이성로
    • 말소리와 음성과학
    • /
    • 제2권3호
    • /
    • pp.141-148
    • /
    • 2010
  • In this paper, voice activity detection (VAD) for dual-channel noisy speech recognition is proposed in which spatial cues are employed. In the proposed method, a probability model for speech presence/absence is constructed using spatial cues obtained from dual-channel input signal, and a speech activity interval is detected through this probability model. In particular, spatial cues are composed of interaural time differences and interaural level differences of dual-channel speech signals, and the probability model for speech presence/absence is based on a Gaussian kernel density. In order to evaluate the performance of the proposed VAD method, speech recognition is performed for speech segments that only include speech intervals detected by the proposed VAD method. The performance of the proposed method is compared with those of several methods such as an SNR-based method, a direction of arrival (DOA) based method, and a phase vector based method. It is shown from the speech recognition experiments that the proposed method outperforms conventional methods by providing relative word error rates reductions of 11.68%, 41.92%, and 10.15% compared with SNR-based, DOA-based, and phase vector based method, respectively.

  • PDF

청각 모델을 이용한 Cochannel 음성에서의 피치 추출에 관한 연구 (A Study on Pitch Detection using Cochlear Model on Cochannel Speech)

  • 신대규;신중인;이재혁;한두진;박상희
    • 대한전기학회논문지:시스템및제어부문D
    • /
    • 제49권6호
    • /
    • pp.330-333
    • /
    • 2000
  • In this paper, a new pitch estimation method is proposed using the Robinson cochlear model. This estimation method is useful in noisy environments and especially very efficient under cochannel in which two speaker voices exist at the same time. For the one speaker speech, the pitch can be extracted from just the neurogram of the Robinson cochlear model. In this case, as the estimation is performed in time domain, the exact pitch period can be detected though the pitch period is various. But in noisy and cochannel cases, the neurogram has many spurious peaks, so we use the autocorrelators in the neurogram to manifest the period. It the autocorrelators are used for the all delays, the large amount of calculations is necessary. Due to this defect, we propose that the autocorrelators are used for the part of the delays on which energy is concentrated. First of all, the proposed algorithm is applied to the one speaker speech, and later to the cochannel speech. And then the results are compared with the autocorrelation pitch detection method.

  • PDF