• Title/Summary/Keyword: 음성 훈련

Search Result 277, Processing Time 0.071 seconds

A Comparative Study of Recognition Rate According to the Variance of Speech Bandwidth (대역폭 변화에 따른 음성 인식률 비교연구)

  • Sohn, Il-Hyun;Doh, Sam-Joo;Koo, Myoung-Wan
    • Annual Conference on Human and Language Technology
    • /
    • 1992.10a
    • /
    • pp.193-199
    • /
    • 1992
  • 이 논문에서는 123개 단어의 한국어 음성에 대하여 음성의 대역폭 변화에 따른 인식률을 비교하였다. 인식률 비교실험을 위해 hidden Markov model과 음소와 유사한 131개의 한국어 subword 유니트를 사용한 화자독립 격리단어 인식 시스팀을 사용하였다. 이 실험은 대역폭이 각각 0 - 4.5kHz 및 0.3 - 3.3kHz인 두가지 종류의 음성 데이타베이스를 사용하였다. 훈련과정에서 corrective training의 반복회수를 2로 하고 state transition duration 정보를 사용하였을 때, 0 - 4.5kHz 와 0.3 - 3.3kHz 대역폭에 대해 각각 98.8 % 및 98.2 % 의 최고 인식률을 얻었다. 이로부터 전화대역폭에서도 음성인식률은 크게 저하되지 않음을 알 수 있다.

  • PDF

A Study on Noisy Speech Recognition Using a Bayesian Adaptation Method (Bayesian 적응 방식을 이용한 잡음음성 인식에 관한 연구)

  • 정용주
    • The Journal of the Acoustical Society of Korea
    • /
    • v.20 no.2
    • /
    • pp.21-26
    • /
    • 2001
  • An expectation-maximization (EM) based Bayesian adaptation method for the mean of noise is proposed for noise-robust speech recognition. In the algorithm, the on-line testing utterances are used for the unsupervised Bayesian adaptation and the prior distribution of the noise mean is estimated using the off-line training data. For the noisy speech modeling, the parallel model combination (PMC) method is employed. The proposed method has shown to be effective compared with the conventional PMC method for the speech recognition experiments in a car-noise condition.

  • PDF

Customized Speech Synthesis for Children with Characteristic Behavioral Patterns (어린이 행동 패턴에 기반한 개별화된 음성 합성)

  • Lee, Ho-Joon;Park, Jong-C.
    • 한국HCI학회:학술대회논문집
    • /
    • 2006.02a
    • /
    • pp.571-578
    • /
    • 2006
  • 음성을 통한 사용자 간의 정보 교환 방법은 추가적인 훈련 과정이나 장비가 필요하지 않고 공간 제약이 거의 없기 때문에 노약자 등 사용자의 연령대에 관계없이 사용될 수 있다. 또한 음성 정보는 시각이나 촉각 등 다른 정보 수단과의 상호 작용으로 상승 효과를 유발할 수 있기 때문에 사람과 기계 사이의 인터페이스로 활용될 경우 정보 전달력을 높이면서 사용자 친화적인 서비스를 제공할 수 있다. 그러나 동일한 상황에서 동일한 유형의 음성 정보가 사용자에게 지속적으로 제공될 경우 표현상의 단조로움으로 인해 정보 전달력이 급감할 수 있는 문제점도 지니고 있다. 따라서 음성을 통한 정보 전달의 경우 동일 상황이라 하더라도 사용자의 행동 패턴, 심리 상태, 주변 환경 등에 따라 차별화된 문장 구조 및 어휘의 선택으로 긴장감을 유지시켜 줄 수 있어야 한다. 본 논문에서는 5 세 전후의 어린이를 대상으로 그들의 행동 패턴 분석에 기반하여 개별화된 음성 합성 결과를 제공하는 시스템을 제안한다. 이를 위해 유치원이라는 물리적 공간에서 어린이들의 주된 행동 패턴을 분석하고, 현직 유치원 교사를 대상으로 동일한 정보를 전달하는 조건을 통하여 어린이의 행동 패턴과 위치 정보, 연령 및 성격에 따른 발화 문장의 문장 구조와 어휘적 특성을 파악한다. 최종적으로, 개별화된 음성 합성 결과를 위해 유치원 공간을 시뮬레이션 하고 RFID 를 이용하여 어린이의 행동 패턴 및 위치 정보를 파악한다. 그리고 각 상황에 따라 분석된 발화문의 문장 구조와 어휘 특성을 반영하여 음성으로 합성될 문장의 문장 구조 및 어휘를 재구성하여 사용자 개별화된 음성 합성 결과를 생성한다. 이러한 결과를 통해 어린이의 행동 패턴이 발화문의 문장 구조 및 어휘에 미치는 영향에 대해서 살펴보고 재구성된 결과 발화문을 평가한다.

  • PDF

Hybrid ASR Error Correction Using Word Sequence Pattern and Recurrent Neural Network (단어열 패턴 매칭과 Recurrent Neural Network를 이용한 하이브리드 음성 인식 오류 수정 방법)

  • Choi, Junhwi;Ryu, Seonghan;Lee, Kyusong;Park, Seonyeong;Yu, Hwanjo;Lee, Gary Geunbae
    • Annual Conference on Human and Language Technology
    • /
    • 2015.10a
    • /
    • pp.129-132
    • /
    • 2015
  • 본 논문에서는 단어열 패턴과 리커런트 신경망을 이용한 하이브리드 음성 인식 오류 수정 방법을 제안한다. 음성 인식 결과 문장에서 음성 인식 오류 단어가 발견되었을 경우에 첫째로 단어열 패턴과 그 패턴의 발음열 점수를 통해 1차적 수정을 하고 적절한 패턴을 찾지 못하였을 경우 음절단위로 구성된 Recurrent Neural Network를 통해 단어를 음절단위로 생성하여 2차적으로 오류를 수정한다. 해당 방법론을 한국어로 된 음성 인식 오류와 그 정답 문장으로 구성된 TV 가이드 영역 말뭉치를 바탕으로 성능을 평가하였고, 기존의 단순 단어열 패턴 기반의 음성 인식 오류 수정보다 성능이 향상되었음을 볼 수 있었다. 이 방법론은 음성 인식 오류와 정답의 말뭉치가 필요 없이 옳은 문장으로만 구성된 일반 말뭉치만으로 훈련이 가능하여, 음성 인식 엔진에 의존적이지 않는 강점이 있다.

  • PDF

Automatic Generation of Training Data for Korean Speech Recognition Post-Processor (한국어 음성인식 후처리기를 위한 학습 데이터 자동 생성 방안)

  • Seonmin Koo;Chanjun Park;Hyeonseok Moon;Jaehyung Seo;Sugyeong Eo;Yuna Hur;Heuiseok Lim
    • Annual Conference on Human and Language Technology
    • /
    • 2022.10a
    • /
    • pp.465-469
    • /
    • 2022
  • 자동 음성 인식 (Automatic Speech Recognition) 기술이 발달함에 따라 자동 음성 인식 시스템의 성능을 높이기 위한 방법 중 하나로 자동 후처리기 연구(automatic post-processor)가 진행되어 왔다. 후처리기를 훈련시키기 위해서는 오류 유형이 포함되어 있는 병렬 말뭉치가 필요하다. 이를 만드는 간단한 방법 중 하나는 정답 문장에 오류를 삽입하여 오류 문장을 생성하여 pseudo 병렬 말뭉치를 만드는 것이다. 하지만 이는 실제적인 오류가 아닐 가능성이 존재한다. 이를 완화시키기 위하여 Back TranScription (BTS)을 이용하여 후처리기 모델 훈련을 위한 병렬 말뭉치를 생성하는 방법론이 존재한다. 그러나 해당 방법론으로 생성 할 경우 노이즈가 적을 수 있다는 관점이 존재하다. 이에 본 연구에서는 BTS 방법론과 인위적으로 노이즈 강도를 추가한 방법론 간의 성능을 비교한다. 이를 통해 BTS의 정량적 성능이 가장 높은 것을 확인했을 뿐만 아니라 정성적 분석을 통해 BTS 방법론을 활용하였을 때 실제 음성 인식 상황에서 발생할 수 있는 실제적인 오류를 더 많이 포함하여 병렬 말뭉치를 생성할 수 있음을 보여준다.

  • PDF

Study on Improvement for selecting the optimum voice channels in the radio voice communication (무전기 음성통신에서 최적음성채널 선택을 위한 개선방안에 관한 연구)

  • Lew, Chang-Guk;Lee, Bae-Ho
    • The Journal of the Korea institute of electronic communication sciences
    • /
    • v.11 no.2
    • /
    • pp.171-178
    • /
    • 2016
  • An aircraft in flight and ATC(: Air Traffic Controllers) working in the Ground Control Center carry out a voice communication using the radio. Voice signal to be transmitted from the aircraft is received to a plurality of terrestrial sites around the country at the same time. The ATC receives the various quality of voice signal from the aircraft depending on the distance, speed, weather conditions and adjusted condition of the antenna and the radio. The ATC carries out a voice communication with aircraft in the optimal conditions finding the best voice signal. However, the present system chooses the values of the CD(: Carrier Dectect) which is determined to be superior to, based on the input voice level, as optimal channel. Thus this system can not be seen to select the optimal channel because it doesn't consider the effect of the noise which influences on the communication quality. In this paper, after removing the noise in the voice signal, we could give the digitized information and an improved voice signal quality, so that users can select an optimal channel. By using it, when operating the training eavesdropping system or the aircraft control, we can expect prevention accident and improvement of training performance by selecting the improved quality channel.

경직형과 이완형 운동구어장애자의 음운변동 특성

  • 이옥분;박상희
    • Proceedings of the KSLP Conference
    • /
    • 2003.11a
    • /
    • pp.234-235
    • /
    • 2003
  • 목적 : 본 연구의 목적은 기질적 조음장애 중 운동구어장애자의 유형에 따른 음운변동 패턴을 연구하여 각 집단만의 신경학적 손상으로 인한 조음운동 패턴을 분석하고자 하는데 있다. 운동구어장애자의 조음 오류에 대해서 SDO(substitution, distortion, omission) 분석적 접근을 하는 것이 일반적이며 따라서 음운변동 분석을 함으로써 이들의 오류패턴의 유형을 찾고, 언어중재 시에 이들의 조음기관 관련 근운동의 훈련을 보다 체계적으로 실시할 수 있을 것이라고 본다. (중략)

  • PDF

음운 환경이 비음치에 미치는 영향

  • 김민정;심현섭
    • Proceedings of the KSLP Conference
    • /
    • 1999.11a
    • /
    • pp.182-182
    • /
    • 1999
  • Nasometer를 통해 얻은 비음치(nasalance score)는 객관적일 뿐만 아니라 훈련된 언어임상가가 청지각적으로 판단한 비음도와 상관관계가 높기 때문에, 공명장애 진단의 보조자료로 유용하다. 그러나 비음치는 자극어에 따라 다양한 수치를 보이므로 공명장애의 진단을 위해서는 타당하고 신비로운 자극어의 개발이 요구되고 있다 따라서 본 연구는 비음치에 영향을 미치는 주요한 음운 환경이 무엇인지 살펴보고, 무의미 1음절어와 유의미 문장 자극어 중 어떤 것이 더 신뢰로운지 알아보아, 비음치 측적을 위한 자극어 개발에 기초를 마련하고자 하였다. (중략)

  • PDF

A Situational Training System for the food serving in the restaurant based on the Argumented Reality (증강 현실 기반 음식점 서빙 상황훈련 시스템)

  • Jung, Kwang-Il;Kim, Sung-Jin;Kim, Boo-Nyon;Kim, Tae-Young;Lim, Cheol-Su
    • Journal of Korea Game Society
    • /
    • v.9 no.1
    • /
    • pp.135-142
    • /
    • 2009
  • Nowadays, many interface devices or training systems for the disabled are being developed and introduced with the recent development in IT technology but only few training systems for the developmental disabled are introduced. In this paper, we present a situation training system based on the argumented reality in order to help the developmental disabled to increase their management level of capability to the certain situation. Our system is specifically based on the food serving in the restaurant. This maker-based system provides trainees to safely experience various different situations and take the training session under any circumstances. The trainees for this program are able to look around with the HMD on, take the training easily by following the voice instruction, and try situational scenario.

  • PDF

Effects of breathing training in melodic intonation therapy on articulation intelligibility of aphasics: pilot study (멜로디 억양 치료에서 실어증 환자의 조음 명료도에 대한 호흡 훈련 효과: 초기 실험)

  • Kim, Seon Sik;Hong, Geum Na;Choi, Min Joo
    • The Journal of the Acoustical Society of Korea
    • /
    • v.35 no.4
    • /
    • pp.319-329
    • /
    • 2016
  • The present study was to test if breathing training in melodic intonation therapy (MIT) ameliorated the articulation intelligibility of Broca's aphasics or not. The experimental group did breathing training (2 stages) that preceded the MIT. In order to evaluate the efficacy of the MIT intervention, the VOT (Voice Onset Time), the TD (Total Delay), the voice sound intensity and the expiratory volume of the subjects, closely associated with articulation intelligibility were measured before and after the intervention. It was shown that, in the experimental group after the MIT intervention, the VOT and TD were increased on bilabial/p/, alveolar consonant /t/, and soft palatal /k/(p < 0.05), but no significant differences were found on affricate /c/ and fricative /s/(p > 0.05). In the control group, no significant increases in the VOT and TD were observed on all articulation points(p > 0.05). The voice sound intensity which influences the verbal articulation increased in the experimental group after the intervention(p < 0.05), whereas no significant changes were observed in the control group. In conclusion, the breathing training in the MIT was found to result in improving the articulation intelligibility of Broca's aphasiacs.