• 제목/요약/키워드: 음성구간검출

검색결과 158건 처리시간 0.027초

이산 웨이브렛 변환영역에서의 스펙트럼 차감법을 이용한 잡음제거 (Noise Reduction using Spectral Subtraction in the Discrete Wavelet Transform Domain)

  • 김현기;이상운;홍재근
    • 한국멀티미디어학회논문지
    • /
    • 제4권4호
    • /
    • pp.306-315
    • /
    • 2001
  • 잡음환경에서의 음성인식을 위하여 음성에 부가된 잡음을 제거하는 방법에 있어, 기존의 스펙트럼 차감법은 잡음과 음성을 정확히 구별하기 힘들고 정확한 잡음의 특성을 추정할 수 없는 단점이 있다. 또한 웨이브렛 변환영역에서의 잡음제거 방법은 임계값 적용시 저주파 영역보다는 고주파영역에 상대적으로 더 큰 영향을 미쳐 고주파영역에서 신호의 손실이 발생하는 단점이 있다. 본 논문에서는 스펙트럼 차감법 및 웨이브렛 변환을 이용한 잡음제거 방법의 단점을 개선하기 위하여 연속 웨이브렛 변환 영역에서 웨이브렛 계수의 스케일별 표준편차로 묵음구간과 음성 구간을 판별하여 끝점을 검출 후, 잡음이 섞인 음성신호를 이산 웨이브렛 변화에 의해 3개의 대역으로 분리하여 각각의 대역 내에서 스펙트럼 차감법을 적용시키는 방법을 제안한다. 끝점을 검출하고 대역을 나눔으로써 스펙트럼 차감을 적응할 잡음 신호의 특성을 정확히 추출할 수 있다. 실험을 통하여 제안한 방법이 기존의 스펙트럼 차감법 및 웨이브렛 변환을 이용한 잡음제거 방법보다 신호대 잡음비 및 Itakura-Saito거리 측면에서 향상됨을 확인할 수 있었다.

  • PDF

유성음 구간 검출 알고리즘에 관한 연구 (A Novel Algorithm for Discrimination of Voiced Sounds)

  • 장규철;우수영;유창동
    • 음성과학
    • /
    • 제9권3호
    • /
    • pp.35-45
    • /
    • 2002
  • A simple algorithm for discriminating voiced sounds in a speech is proposed. In addition to low-frequency energy and zero-crossing rate (ZCR), both of which have been widely used in the past for identifying voiced sounds, the proposed algorithm incorporates pitch variation to improve the discrimination rate. Based on TIMIT corpus, evaluation result shows an improvement of 13% in the discrimination of voiced phonemes over that of the traditional algorithm using only energy and ZCR.

  • PDF

음성/영상 연동성능 향상을 위한 입술움직임 영상 추적 테스트 환경 구축 (A Lip Movement Image Tracing Test Environment Build-up for the Speech/Image Interworking Performance Enhancement)

  • 이수종;박준;김응규
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2007년도 춘계학술발표대회
    • /
    • pp.328-329
    • /
    • 2007
  • 본 논문은 로봇과 같이 외부 음향잡음에 노출되어 있는 상황 하에서, 대면하고 있는 사람이 입술을 움직여 발성하는 경우에만 음성인식 기능이 수행되도록 하기 위한 방안의 일환으로, 입술움직임 영상을 보다 정확히 추적하기 위한 테스트 환경 구현에 관한 것이다. 음성구간 검출과정에서 입술움직임 영상 추적결과의 활용여부는 입술움직임을 얼마나 정확하게 추적할 수 있느냐에 달려있다. 이를 위해 영상 프레임율 동적 제어, 칼라/이진영상 변환, 순간 캡쳐, 녹화 및 재생기능을 구현함으로써, 다각적인 방향에서 입술움직임 영상 추적기능을 확인해 볼 수 있도록 하였다. 음성/영상기능을 연동시킨 결과 약 99.3%의 연동성공율을 보였다.

EVRC 음성부호화기의 잡음억제단을 이용한 수중 천이신호 검출 (Detection of Underwater Transient Signals Using Noise Suppression Module of EVRC Speech Codec)

  • 김태환;배건성
    • 한국음향학회지
    • /
    • 제26권6호
    • /
    • pp.301-305
    • /
    • 2007
  • 본 연구에서 관심을 갖는 수중환경에서의 천이소음도 가청주파수 대역임에 착안하여 이동통신 시스템의 표준 음성부호화기인 EVRC의 전처리단을 이용하여 배경잡음 구간을 판별하고 이를 바탕으로 수중 천이신호를 탐지하는 알고리즘을 제안하였다. EVRC 전처리 모듈에 프레임 단위의 입력신호가 들어가면 모듈로부터 잡음 구간을 결정하는 플래그, 각 채널의 에너지, 잡음이 제거된 신호, 입력신호의 에너지, 배경잡음의 에너지, 잡음이 제거된 신호의 에너지에 해당하는 파라미터 값을 얻게 된다. 잡음이 제거된 신호의 에너지를 배경잡음의 에너지로 정규화하고 이를 문턱값과 비교함으로써 천이신호를 검출할 수 있다. 또한 문턱 값은 잡음 구간에서 구한 이전 값을 이용해서 갱신된다. 실험결과를 통해 제안한 알고리즘이 백색 또는 유색잡음 하에서도 4% 미만의 오차를 보여주는 것을 검증한다.

AMDF의 회전변환을 이용한 피치 주기 검출 알고리즘 (Pitch Period Detection Algorithm Using Rotation Transform of AMDF)

  • 서현수;배상범;김남호
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2005년도 추계종합학술대회
    • /
    • pp.1019-1022
    • /
    • 2005
  • 최근 정보 통신 기술의 급속한 발전에 의해 음성 신호 처리에 관련된 많은 연구가 진행됨에 따라 피치 주기는 음성 인식, 화자 식별, 음성 분석 및 합성 등과 같은 많은 응용분야에서 중요한 요소로써 적용되고 있다. 이러한 피치 주기 검출에 관련된 시간 영역과 주파수 영역에서의 많은 알고리즘이 제안되었으며, 시간 영역의 피치 검출 알고리즘의 하나인 AMDF(average magnitude difference function)는 각 valley점의 거리를 피치 주기로 계산한다. 그러나 피치 주기 검출을 위한 valley점 선정에 있어서 알고리즘이 복잡해지는 문제점이 발생한다. 따라서 본 논문에서는 AMDF의 회전변환을 이용하여 전체 최소 valley점을 음성 신호의 피치 주기로 인식하는 간단한 알고리즘을 제안하였으며, 음성의 시작구간에 대해 경계값을 설정하여 피치 주기 선정에 대한 판단기준으로 사용하였다. 그리고 제안한 알고리즘을 시뮬레이션을 통해 기존의 방법들과 비교하였다.

  • PDF

주행중인 자동차 환경에서의 음성인식 연구 (A Study on Speech Recognition in a running automobile)

  • 유봉근
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1998년도 학술발표대회 논문집 제17권 1호
    • /
    • pp.47-50
    • /
    • 1998
  • 본 논문은 자동차의 편의성 및 안전성의 동시 확보를 위하여, 보조적 스위치의 조작없이 상시 음성의 입,출력이 가능하도록 하며, band pass filter를 이용하여 잡음환경에서 자동으로 정확하게 음성구간 검출(End Point Detection)을 하게 하였다. Reference Pattern은 Dynamic Multi-Section(DMS)[1] 모델을 사용하였고 차량의 속도에 따라 자동으로 잡음환경에 강인한 모델을 선택하도록 하였으며, 음성의 특징 파라미터와 인식 알고리즘은 Perceptual Linear Predictive(PLP) 13차와 One Stage Dynamic Programming(OSDP)를 사용하였다. 주행중인 자동차 환경(30~70km/h)에서 자주 사용되는 차량제어 명령 33개에 대하여 화자독립 92.98%, 화자종속 94.44% 인식율을 구하였다. 또한 주행중인 차량에서 카폰, 핸드폰 사용으로 인한 사고를 줄이기 위하여 음성으로 전화를 걸 수 있도록 하는 Voice Dialing 기능도 구현하였다.

  • PDF

음성의 잡음레벨 추정을 위한 피치간 유사도 측정에 관한 연구 (A Study on the relation of closed pitch for Noise-Level Measurement)

  • 강인규;강성모;배명진
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2004년도 추계학술발표대회논문집 제23권 2호
    • /
    • pp.73-76
    • /
    • 2004
  • 인간은 "습관적 피치 레벨" 즉 자연스럽게 말할 때 평균적으로 사용하는 피치를 갖는다. 하지만 음성에 잡음이 첨가되면 이 피치가 불규칙하게 바뀌게 된다. 이점을 이용하여 음성의 잡음레벨을 측정할 수 있다. 본 논문에서는 입력음성의 에너지를 구하고 일정 에너지레벨 이상에서의 구간에 대해 NAMDF(Normalized Average Magnitude Difference Function)방법으로 피치를 구하고, 각 프레임을 피치단위로 분절한 뒤 인근 피치간의 유사도를 측정하여 입력음성데이터의 잡음레벨을 검출하는 방법을 제안하였다.

  • PDF

지각 필터 응답 보상을 통한 음질 개선 (Improvement of Sound Quality using Compensation of Perceptual Filter Response)

  • 채병국;차혁근;차형태
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2004년도 추계학술발표대회논문집 제23권 2호
    • /
    • pp.295-298
    • /
    • 2004
  • 본 논문에서는 잡음에 오염된 신호의 지각관계를 해석하여 지각 필터 응답 제어를 통한 음성 신호 개선 알고리즘을 제안한다. 음성 신호 개선 기법은 단일 채널환경에서 사람의 청각시스템에서의 주파수 변별력을 나타내는 각각의 임계대역에 대한 전체 에너지를 나타내는 임계대역 에너지의 지각적인 확산의 영향 즉, 마스킹 확산의 영향을 나타내는 자극에너지를 이용하여 신호와 잡음 에너지에 의해 변화하는 잡음에 의한 신호의 마스킹 구간을 검출하여 묵음 구간 추출 잡음 필터응답과 추정 잡음 오차를 보상시킨 필터응답을 통한 지각 필터 응답을 보상하여 신호를 개선하는 방법이다. 실험 결과 제안한 방법을 통해 SNR에 개선과 음질 개선 효과를 얻을 수 있음을 테스트를 통해 확인하였다.

  • PDF

GSC 기반 빔포밍을 위한 주파수 밴드별 전력비 분포의 혼합 가우시안 모델을 이용한 목표 음성신호의 검출 (Target Speech Detection Using Gaussian Mixture Model of Frequency Bandwise Power Ratio for GSC-Based Beamforming)

  • 장형욱;김영일;정상배
    • 한국정보통신학회논문지
    • /
    • 제19권1호
    • /
    • pp.61-68
    • /
    • 2015
  • 다양한 종류의 잡음에 의해서 발생하는 음성인식 성능 저하를 보상하기 위해서는 잡음제거가 필수적이다. 마이크로폰 배열을 이용하는 많은 잡음제거 기술 중에서, GSC는 비정상성 잡음을 제거하기 위해서 널리 적용되어 왔다. GSC의 성능은 AMC에 의해서 직접적인 영향을 받는다. 즉, 정확한 목표 음성 신호의 검출은 순수 잡음구간에서의 충분한 잡음제거 및 목표 음성구간에서의 적은 왜곡을 보장하기 위해서 필수적이다. 따라서, 본 논문에서는 고정 빔포밍의 출력과 차단 매트릭스의 출력간의 전력비가 주파수 밴드 단위로 계산되는 향상된 AMC 설계법을 제안한다. 그 후, 밴드별 전력비는 가우시안 혼합에 의해서 각 클래스가 확률적으로 모델링 된다. 실험결과, 제안한 알고리즘이 ROC 및 출력 SNR 관점에서 더 높은 성능을 보였다.

심리 음향 기준을 이용한 새로운 음질 개선 방법 (New Speech Enhancement Method using Psychoacoustic Criteria)

  • 김대경;박장식;손경식
    • 한국멀티미디어학회논문지
    • /
    • 제4권1호
    • /
    • pp.56-66
    • /
    • 2001
  • 최근에 심리 음향 기준을 이용한 스펙트럼 차감법이 제안되었다. Virag의 알고리즘에서는 기존의 방법보다 청취자가 더 편안한 음성을 들을 수 있지만 잡음에 강인한 음성활동 검출기가 필요하다. 음성활동 검출기를 필요로 하지 않는 확장 스펙트럼 차감법에서는 신호 대 잡음비가 감소함에 따라 잔여 잡음이 더욱 잘 들리게 된다. 본 논문에서는 심리 음향 기준을 이용한 스펙트럼 차감법에 Wiener 필터를 결합한 새로운 음질 개선 방법을 제안한다. 제안한 방법에서는 Wiener 필터를 사용하여 음성 구간에 서도 잡음의 추정치가 계속 갱신되므로 음성 검출기가 필요 없고 마스킹 임계값에 따라 차감 파라미터를 조정하기 때문에 잔여 잡음이 거의 들리지 않게 된다. 제안된 방법에 대하여 시뮬레이션을 통하여 기존의 스펙트럼 차감법과 성능을 비교한 결과, 제안한 방법을 사용하여 개선된 음성이 기존의 방법에 비하여 청취하기에 더 편한 음질을 제공하였다.

  • PDF