Abstract
Recently, neural network-based speech recognition has been studied to utilize the adaptivity and learnability of neural network models. However, conventional neural network models have difficulty in the co-articulation processing and the boundary detection of similar phonmes of the Korean speech. Also, in case of using one phonotopic map, learning speed may dramatically increase and inaccuracies may be caused because homogeneous learning and recognition method should be applied for heterogenous data. Hence, in this paper, a neural net typewriter has been designed using a hierarchical self-organizing classifier(HSOC), and related algorithms are presented. This HSOC, during its learing stage, distributed phoneme data on hierarchically structured multiple phonotopic maps, using Kohonen's self-organizing feature maps(SOFM). Presented and experimented in this paper were the algorithms for deciding the number of maps, map sizes, the selection of phonemes and their placement per map, an approapriate learning and preprocessing method per map. If maps are divided according to a priorlinguistic knowledge, we would have difficulty in acquiring linguistic knowledge and how to alpply it(e.g., processing extended phonemes). Contrarily, our HSOC has an advantage that multiple phonotopic maps suitable for given input data are self-organizable. The resulting three korean phonotopic maps are optimally labelled and have their own optimal preprocessing schemes, and also confirm to the conventional linguistic knowledge.
최근, 신경망 모델의 적응성과 학습성을 이용한 음성인식 연구가 진행되어 왔다. 그러나, 기존의 신경망 모델로는 한국어 음성의 조음결합의 처리 및 유사 음소간의 경계 분류가 용이하지 않다. 또한, 한 개의 형상지도를 이용하는 경우 이질적인 음성자료의 처리를 위한 학습속도의 급격한 증가와 균일한 학습 및 판별방법의 적용이 갖는 부정확성이 야기될 수 있다. 이에따라, 본 논문에서는 계층적 자기조직화 분류기(HSOC)를 이용한 신경망타자기를 설계하고, 관련 알고리즘들을 제안한다. 본 HSOC는 Kohonen의 자기조직화형상지도(SOFM)를 이용하여 학습시 입력되는 음소 데이타를 계층적인 구조를 갖는 다수의 형상 지도(map) 즉 음성자판에 배치한다. 또한 본 논문에서는 자판의 수효, 각 자판의 크기, 소속될 음소의 선택과 배치, 적합한 학습 및 인식기법의 자동 결정을 위한 알고리즘을 제시하고 실험하여 자기조절식인 음성자판을 구성하였다. 자판을 분류하는 방식을 언어학적 사전지식에 의존할 경우 언어학적 지식의 습득과 적용방법(예를 들면, 확장 음소의 처리)등을 결정하는 어려움을 가지는 반면, 본 HSOC를 이용하면 주어진 입력 데이타에 적합한 다수의 음성자판을 자기 조절식으로 구성할 수 있는 장점이 있다. 제안된 방식에 따라 최종 생성된 세 개의 한글 음성자판은 최적 자판과 최적 전처리기법을 갖추고있으며, 기존의 언어학적 지식과도 부합됨을 확인할 수 있었다.