Search | Korea Science

Voice Activity Detection Based on SVM Classifier Using Likelihood Ratio Feature Vector (우도비 특징 벡터를 이용한 SVM 기반의 음성 검출기)

Jo, Q-Haing;Kang, Sang-Ki;Chang, Joon-Hyuk
- The Journal of the Acoustical Society of Korea
- /
- v.26 no.8
- /
- pp.397-402
- /
- 2007
In this paper, we apply a support vector machine(SVM) that incorporates an optimized nonlinear decision rule over different sets of feature vectors to improve the performance of statistical model-based voice activity detection(VAD). Conventional method performs VAD through setting up statistical models for each case of speech absence and presence assumption and comparing the geometric mean of the likelihood ratio (LR) for the individual frequency band extracted from input signal with the given threshold. We propose a novel VAD technique based on SVM by treating the LRs computed in each frequency bin as the elements of feature vector to minimize classification error probability instead of the conventional decision rule using geometric mean. As a result of experiments, the performance of SVM-based VAD using the proposed feature has shown better results compared with those of reported VADs in various noise environments.
https://doi.org/10.7776/ASK.2007.26.8.397 인용 PDF KSCI

A Probabilistic Combination Method of Minimum Statistics and Soft Decision for Robust Noise Power Estimation in Speech Enhancement (강인한 음성향상을 위한 Minimum Statistics와 Soft Decision의 확률적 결합의 새로운 잡음전력 추정기법)

Park, Yun-Sik;Chang, Joon-Hyuk
- The Journal of the Acoustical Society of Korea
- /
- v.26 no.4
- /
- pp.153-158
- /
- 2007
This paper presents a new approach to noise estimation to improve speech enhancement in non-stationary noisy environments. The proposed method combines the two separate noise power estimates provided by the minimum statistics (MS) for speech presence and soft decision (SD) for speech absence in accordance with SAP (Speech Absence Probability) on a separate frequency bin. The performance of the proposed algorithm is evaluated by the subjective test under various noise environments and yields better results compared with the conventional MS or SD-based schemes.
https://doi.org/10.7776/ASK.2007.26.4.153 인용 PDF KSCI

Speech Enhancement Based on Soft Decision for Effective Noise Suppression (효율적인 잡음억제를 위한 Soft Decision 기반의 음성향상 기법)

Lim Hyoung-Keun;Kim Yu-Jin;Chung Jae-Ho
- Proceedings of the Acoustical Society of Korea Conference
- /
- spring
- /
- pp.47-50
- /
- 2000
비상관적인 가산잡음에 오염된 음성으로부터 향상된 음성을 얻기 위한 방법 중 Soft Decision에 근거한 음성 향상 기법이 뛰어난 성능을 가진다고 알려져 있다. Soft Decision은 주파수 영역에서 음성에 가산된 잡음을 처리하며, 잡음 환경에 대한 사전정보에 의존적이다. 본 연구에서는 Soft Decision을 근거로 음성에 가산된 잡음신호를 비선형 처리를 하여 효과적으로 음성에 포함된 잡음을 추정하도록 하였으며, 잡음환경에 대한 사전 정보 없이 효율적으로 잡음을 억제하는 방법을 제안한다. 본 연구에서 제안한 음성향상 기법은 주관적인 음질평가에서 기존의 방법들보다 나은 성능을 나타내었다
PDF

Performance Evaluation of Acoustic Models According to Differences between Vocabularies in Training and Test Phases of Speech Recognition (음성 인식에서 훈련 및 인식 과정에 사용되는 대상 어휘의 차이에 대한 음향 모델의 성능 평가)

김회린;이항섭;권오욱
- The Journal of the Acoustical Society of Korea
- /
- v.17 no.7
- /
- pp.22-27
- /
- 1998
본 논문에서는 ETRI에서 개발한 가변 어휘 음성 인식기의 어휘 독립 음향 모델링 방법을 기술하고, 이 모델의 어휘 종속, 어휘 독립 및 어휘적응 성능을 평가하기 위하여 다 양한 고립단어 및 연속음성 DB에 대하여 실험한 결과를 분석하였다. 평가를 위하여 사용한 음성 DB로는 고립단어 음성으로 POW(Phonetically Optimized Words) 3848, PBW(Phonetically Balanced Words) 445, PBW 452, 호텔예약 244 단어, 게임 제어용 단어 등이며, 연속음성으로 일반 문장 음성 및 연속 숫자음을 이용하였다. 성능 분석 결과 40개 음소 모델만으로도 비교적 높은 인식률을 보여 주었지만, 어휘독립의 경우는 어휘종속에 비 하여 성능이 크게 낮았고, 특히 대상 어휘가 숫자음, 알파벳, 연속음 등의 경우에는 POW 데이터나 PBW 데이터만 가지고는 우수한 가변 어휘 음성 인식기를 구현하기에 한계가 있 음을 알 수 있다. 또한, 훈련 데이터의 어휘와 평가데이터의 어휘가 비슷할 경우에는 변이음 모델을 사용하면 음소 모델만을 사용할 경우에 비하여 그 성능이 우수하였지만, 일반적인 어휘독립의 상황에서는 효과가 별로 없음을 알 수 있었다.
PDF

Speech Input/Output Processing Technology for Human-Computer Interface (HCI를 위한 음성 입출력 처리 기술 개발)

이영직
- Proceedings of the Acoustical Society of Korea Conference
- /
- 1998.08a
- /
- pp.367-370
- /
- 1998
정보통신부 출연의 "HCI를 위한 음성 입출력 처리 기술 개발" 과제에 대하여 기술한다. 이 과제의 주 목적은 PC 윈도우 환경에서 사람과 기계 간의 음성 입출력 기술을 개발하는 것이다. 이를 위해 음성 인식 분야에서는 화자 적응, 잡음 적응, 및 인식 대상 어휘 적응 기술을 개발하며, 합성 분야에서는 시스템 메시지 합성 기술을 개발한다. 또, 음성이 기존의 입출력 수단인 키보드나 마우스를 모두 대치할 수 없으므로, 본 과제에서는 음성이 추가됨으로써 입출력이 편리해지는 다중 모드 입출력 기술의 갭라에 초점을 맞추어 기술을 개발하고 있다. 인식 분야의 주요 연구내용은 음성검출 및 비음성 제거, 인식 속도 향상, 인식 성능 향상이며, 합성 분야 주요 연구 항목은 학습형 합성기 알고리즘 및 이의 문제점 해결이다. 본 논문은 이러한 점을 정리하여 발표한다.정리하여 발표한다.
PDF

Speech Enhancement for DMB Voice commander in Car environment (차량환경에서 DMB용 음성명령어기 사용을 위한 음성개선방법)

Beack Seung Kwon;Hahn Minsoo;Nam Seung Hyon;Kang Kyung Ook
- Proceedings of the Korean Society of Broadcast Engineers Conference
- /
- 2003.11a
- /
- pp.233-236
- /
- 2003
본 논문에서는 차량용 음성명령어기의 사용을 위한 전처리 과정으로 음성개선 방법을 다룬다. 특히 DMB 사용환경에서 보다 주위 소음에 자유롭고 단말 조작에 있어 안정성을 보장하기 위하여 일반적 단인 마이크로폰으로 처리되는 잡음뿐만 아니라 음성명령어를 제외한 오디오 신호 등 비정적 통계적 특성을 갖는 소음들도 제거 될 수 있도록 음성개선 방법을 제안한다. 우리는 2개의 마이크로폰을 가지고 BSS 알고리즘을 적용하여 비정적 신호들을 분리하고, 분리된 신호에 대하여 Kalman Filter를 이용하여 시간상 단구간 정적 잡음을 제거한다. 본 논문의 인식 실험 결과를 통하여 공간적, 시간적 음성개선 방법이 순차적으로 적용될 때, 실제 차량 환경에서 음성 개선 알고리즘으로 적용될 수 있음을 보였다
PDF

Influence of SNR difference on the Korean speech intelligibility in classrooms (교실에서 신호대잡음비 변이가 한국어 음성명료도에 미치는 영향)

Park, Chan-Jae;Jo, Sung-Min;Haan, Chan-Hoon
- The Journal of the Acoustical Society of Korea
- /
- v.38 no.6
- /
- pp.651-660
- /
- 2019
The present study aims to find out the necessary speech sound level which can satisfy with the speech intelligibility in a noisy classroom environments. For this, auralized materials were made to undertake listening tests with 27 people. Speech intelligibility tests were carried out using both Consonant-Vowel-Consonant (CVC) and Phonetically Balanced Words (PBW) methods. Signal to noise ratio was changed by 5 dB for each test. As a result, it was found that speech intelligibilities are increasing with larger Signal to Noise Ratio (SNR). It was also found that there is a lot of difference of speech intelligibilities by SNR for syllables (CVC) with the Reverberation Time (RT) of 1.5 s. However, any significant difference was not found for words (PBW) in the case with RTs of below 0.8 s. Also, it was revealed through the 2-way analysis of variance (ANOVA) test that SNR is the only attentive factor which can affect the Korean speech intelligibilities for both PBW and CVC methods. Therefore, RTs below 0.8 s could be the acoustic criteria for classroom which can minimize the effects of noise. In the case with RTs larger than 0.8 s, much larger SNR is needed to give sufficient speech intelligibility.
https://doi.org/10.7776/ASK.2019.38.6.651 인용 PDF KSCI

The Status of Speech Recognition Technology and its Prospects on Practical Applications (음성인식기술의 현황과 실용화 전망)

구명완
- Proceedings of the Acoustical Society of Korea Conference
- /
- 1998.06c
- /
- pp.17-22
- /
- 1998
본고에서는 음성인식기술의 최근동향을 알아보고 국외의 실용화사례를 통신사업자와 비통신사업자 주축으로 이루어지고 있는 응용사례를 소개한다. 현재의 음성인식 기술중 최근 주목을 받고 있는 발화 확인기술과 탐색기술을 소개하고 외국의 실용화 사례를 통신분야와 비통신 분야로 나누어서 기술한다. 그리고 실용화 전망에 대해 고찰한 후 결론을 맺는다.
PDF

스마트폰 음성 통신용 음성 검출 기술

Kim, Sang-Gyun;Jang, Jun-Hyeok
- Information and Communications Magazine
- /
- v.29 no.4
- /
- pp.10-14
- /
- 2012
본고에서는 스마트폰 환경에서 음성 통신에 필요한 가변 전송률 음성 부호화기를 위한 음성 검출 기술을 알아본다. 소개할 음성 검출 기술은 통계적 모델(statistical model)을 기반으로 한 우도비 테스트(likelihood ratio test, LRT)를 이용하여 음성 존재 여부를 판단하는 결정법을 유도한다. 이후 통계적 모델을 기반으로 한 음성 검출 방법의 신뢰도를 높이기 위해 새로운 방법들이 연구되었으며 최근까지 연구가 진행 중인 통계적 모델 기반의 음성 검출 방법을 소개한다.
PDF KSCI

SFSWin을 이용한 음성분석 방법

양병곤
- Proceedings of the KSLP Conference
- /
- 2003.11a
- /
- pp.159-161
- /
- 2003
일상생활 중에 많은 사람들이 과도한 음성을 사용하게 되어 자신도 모르는 사이에 발성기관의 이상이 생기는 경우를 본다. 이러한 병적인 음성을 분석하기 위해서는 정상적인 음성의 특징을 먼저 객관적으로 분석하고 이들의 기준치를 잡은 다음 병적인 음성의 특징이 그 기준에서 얼마나 벗어났는지를 밝히는 과정이 필요하다. 사람의 음성을 지문과 같이 나타내는 음성분석 소프트웨어가 다양하게 개발되어 왔다. 시중에는 너무 간단하여 사용하기는 편하나 학술 논문을 작성할 때 사용할 만큼 정확한 데이터를 제공하지 못하는 프로그램이 있고, 반면에 매우 복잡한 기능들이 들어가 있어서 단순한 분석을 위해 그 모든 기능들을 익혀야 하는 불편한 프로그램도 나와 있다. 특히, 비싼 하드웨어를 동반한 소프트웨어들은 가격에 비해 사용자의 편의를 고려하지 않는 프로그램들도 있다. (중략)
PDF

Search Result 1,997, Processing Time 0.03 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)