• 제목/요약/키워드: Female speakers

검색결과 124건 처리시간 0.02초

동적 성대 모델을 이용한 후두 내 유동 및 음향장에 대한 수치 연구 (Computation of Laryngeal Flow and Sound through a Dynamic Model of the Vocal Folds)

  • 배영민;문영준
    • 한국전산유체공학회:학술대회논문집
    • /
    • 한국전산유체공학회 2008년도 춘계학술대회논문집
    • /
    • pp.21-24
    • /
    • 2008
  • The present study numerically investigates the glottal airflow characteristics as well as acoustic features of phonation fully coupled with dynamic behavior of vocal folds. The vocal folds are described by a low-dimensional body-covered model characterized by bio-mechanical parameters such as glottal width, vocal folds stiffness, and subglottal pressure. The flow in the vocal tract is modeled as an incompressible, axisymmetric form of the Navier-Stokes equations (INS), while the acoustic field is predicted by the linearized perturbed compressible equations (LPCE). The computed result shows that a two-mass model of vocal folds is sufficient to reproduce temporal variations in oral airflow and glottis motion produced by female speakers. It is also found that i) the glottal width has a significant effect on the amplitude of glottal flow, and thus on the amplitude of acoustic wave in the vocal tract, ii) the vocal fold tension is the main control parameter for the fundamental frequency of phonation, iii) the subglottal pressure plays an appreciable role on reproduction of the self-sustained oscillation of vocal folds, and iv) the strength of pulsating airflow and vortical structures are primarily affected by glottal width and subglottal pressure, and are closely related to pitch, loudness, and voice quality. Finally, more comprehensive explanation about the difference between one- and two-mass models is presented with discussion of effectiveness of vocal folds oscillation and voice quality.

  • PDF

Phonological processes of vowels from orthographic to pronounced words in the Buckeye Corpus by sex and age groups

  • Yang, Byunggon
    • 말소리와 음성과학
    • /
    • 제10권2호
    • /
    • pp.25-31
    • /
    • 2018
  • This paper investigated the phonological processes of monophthongs and diphthongs in the pronounced words present in the Buckeye Corpus and compared the frequency distribution of these processes by sex and age groups to provide a clearer understanding of spoken English to linguists and phoneticians. Both orthographic and pronounced words were extracted from the transcribed label scripts of the Buckeye Corpus using R. Next, the phonological processes of monophthongs and diphthongs in the orthographic and pronounced labels were tabulated using R scripts, and a frequency distribution by vowel process types, as well as sex and age groups, was created. The results revealed that 95% of the orthographic words contained the same number of syllables, whereas 5% had different numbers of vowels, thereby proving that speakers tend to preserve vowels in spontaneous speech. In addition, deletion processes were preferred in natural speech. Most vowel deletions occurred with an unstressed syllable. Chi-square tests were performed to calculate dependence in the distribution of phonological process types for male and female groups and young and old groups. The results showed a very strong correlation. This finding indicates that vowel processes occurred in approximately the same pattern in natural and spontaneous speech data regardless of sex and age, as well as whether or not the vowel processes were identical. Based on these results, the author concludes that an analysis of phonological processes in spontaneous speech corpora can greatly enhance practical understanding of spoken English.

미국인 남성과 여성이 발음한 영어이중모음의 음향적 연구 (An Acoustical Study of English Diphthongs Produced by American Males and Females)

  • 양병곤
    • 말소리와 음성과학
    • /
    • 제2권2호
    • /
    • pp.43-50
    • /
    • 2010
  • English vowels can be divided into monophthongs and diphthongs depending on the number of vocal tract shapes. Diphthongs are usually produced with more than one shape. This study attempts to collect acoustical data of English diphthongs published by Hillenbrand et al.(1995) online and to examine acoustic features of the diphthongs for phoneticians and English teachers. Sixty three American males and females were chosen after excluding those subjects with different target vowels or ambiguous formant tracks. The author used Praat to obtain the acoustical data systematically at eleven equidistant timepoints over the diphthongal segment. Obvious errors were corrected based on the spectrographic display of each diphthong. Results show that the formant trajectories of the diphthongs produced by the American males and females appeared quite similar. When the female formant values were uniformly normalized to those of the males, almost a perfect collapse occurred. Secondly, the diphthongal movements on the vowel space appeared not linear due to the coarticulatory gesture for the following consonant. Thirdly, the average duration of the diphthongs produced by the females was 1.156 times longer than that of the males while the pitch ratio between the two groups turned out to be 1.746 with a similar contour over measurement points. The author concludes that English diphthongs produced by various groups can be compared systematically when the acoustical values are obtained at proportional timepoints. Further studies will be desirable on the comparison of English diphthongs produced by native and nonnative speakers.

  • PDF

대용량 데이터베이스를 이용한 한국어 운율 특성에 관한 연구 (A Prosodic Study of Korean Using a Large Database)

  • 김종진;이숙향
    • 한국음향학회지
    • /
    • 제24권2호
    • /
    • pp.117-126
    • /
    • 2005
  • 본 연구는 대용량 데이터베이스 분석을 통한 한국어의 운을 특성 규명을 시도하였다. 남녀 화자 1명씩 각각 낭독한 650개의 뉴스기사 문장 (총 1,300 개)은 분절음 레이블링과 운율 레이블링을 한 후, 각 운율단위의 성조유형과 크기, 상위운율단위의 크기와 하위 운율단위 수간의 상관관계, 그리고 강세구의 하강곡선과 상승곡선의 기울기와 F0 값에 대한 비교분석을 수행하였다. 운율단위의 지속시간, 어절수, 음절수와 하위 운율단위의 수는 화자뿐만 아니라 운율단위 위치에 따라서 차이를 보였으며 하위 운율단위의 수는 상위 운율단위의 음절수와 지속시간과 높은 상관관계를 보였다. 강세구 내의 하강곡선의 기울기는 강세구 음절수와 반비례 관계를 보였으며 강세구 첫 성조의 유형에 따라 기울기 값에 차이가 있었다. 이 차이는 고성조로 시작한 강세구 성조의 F0 상승과 성조 간 상승 폭의 차이로 설명할 수 있었다. 강세구 경계의 하강곡선은 일정하면서 강세구 내의 하강곡선에 비해 다소 급격한 기울기를 보였다. 강세구 내의 두 상승곡선은 유사한 기지값을 보였으나 강세구 시작 상승곡선의 F0 변화량이 끝 상승곡선의 F0 변화량보다 크게 나타났다. 그리고 하나의 상승곡선이 강세구를 이루는 L Ha의 경우에는 강세구의 음절수에 반비례 관계를 보였다.

Coordinative movement of articulators in bilabial stop /p/

  • Son, Minjung
    • 말소리와 음성과학
    • /
    • 제10권4호
    • /
    • pp.77-89
    • /
    • 2018
  • Speech articulators are coordinated for the purpose of segmental constriction in terms of a task. In particular, vertical jaw movements repeatedly contribute to consonantal as well as vocalic constriction. The current study explores vertical jaw movements in conjunction with bilabial constriction in bilabial stop /p/ in the context /a/-to-/a/. Revisiting kinematic data of /p/ collected using the electromagenetic midsagittal articulometer (EMMA) method from seven (four female and three male) speakers of Seoul Korean, we examined maximum vertical jaw position, its relative timing with respect to the upper and lower lips, and lip aperture minima. The results of those dependent variables are recapitulated in terms of linguistic (different word boundaries) and paralinguistic (different speech rates) factors as follows. Firstly, maximum jaw height was lower in the across-word boundary condition (across-word < within-word), but it did not differ as a function of different speech rates (comfortable = fast). Secondly, more reduction in the lip aperture (LA) gesture occurred in fast rate, while word-boundary effects were absent. Thirdly, jaw raising was still in progress after the lips' positional extrema were achieved in the within-word condition, while the former was completed before the latter in the across-word condition. Lastly, relative temporal lags between the jaw and the lips (UL and LL) were more synchronous in fast rate, compared to comfortable rate. When these results are considered together, it is possible to posit that speakers are not tolerant of lenition to the extent that it is potentially realized as a labial approximant in either word-boundary condition while jaw height still manifested lower jaw position in the across-word boundary condition. Early termination of vertical jaw maxima before vertical lower lip maxima across-word condition may be partly responsible for the spatial reduction of jaw raising movements. This may come about as a consequence of an excessive number of factors (e.g., upper lip height (UH), lower lip height (LH), jaw angle (JA)) for the representation of a vector with two degrees of freedom (x, y) engaged in a gesture-based task (e.g., lip aperture (LA)). In the task-dynamic application toolkit, the jaw angle parameter can be assigned numerical values for greater weight in the across-word boundary condition, which in turn gives rise to lower jaw position. Speech rate-dependent spatial reduction in lip aperture may be able to be resolved by means of manipulating activation time of an active tract variable in the gestural score level.

벡터 양자화 화자적응기법을 사용한 한국어 단어 인식 (Korean Word Recognition Using Vector Quantization Speaker Adaptation)

  • 최갑석
    • 한국음향학회지
    • /
    • 제10권4호
    • /
    • pp.27-37
    • /
    • 1991
  • 본 논문에서는 퍼지벡터양자화보다 양자화 왜곡을 더욱 저감시키기 위하여 에너지부분공간을 도입한 퍼지벡터양자화(energy subspace fuzzy vector quatization : ESFVQ)를 제안하였으며, 그것을 화자적응에 적용한 에너지부분공간 퍼지벡터양자화 화자적응기법에 의하여 미지화자의 한국어 단어를 인식하였다. 화자적응을 위한 학습과정에서 에너지 부분공간에 따른 퍼지 히스토그램으로 사상코드북을 작성하였으며, 인식과정에서 미지화자의 음성을 ESFVQ에 의해 복화화하므로써 인식율의 향상을 도모하였다. 남성 2인과 여성 1인이 발성한 DDD 전화 지역명에 대하여 ESFVQ에 의한 양자화 왜곡 및 화자적응 단어 인식율을 측정하여 그 성능을 평가하였다. ESFVQ의 양자화 왜곡은 벡터 양자화보다 22% 감소되었으며, 퍼지 벡터 양자화보다 5% 감소되었다. 또한, ESFVQ에 의한 화자적응방법으로 인식한 결과, 화자적응을 고려하지 않은 방법보다 26%, 벡터 양자화에 의한 방법보다 11%의 향상된 인식율을 얻을 수 있었다.

  • PDF

Praat소프트웨어 프로그램을 이용한 영어모음 길이에 관한 실험적 연구 (An Experimental Study on the English Vowel Lengths Using the Praat Software Program)

  • 박희석
    • 디지털콘텐츠학회 논문지
    • /
    • 제13권3호
    • /
    • pp.279-290
    • /
    • 2012
  • 본 연구는 Praat 소프트웨어 프로그램을 이용하여 영어이중모음 /eɪ/ 와 /aɪ/, 그리고 영어전설저모음 /æ/의 발음 길이에 관해 한국인 피 실험자와 원어민 피 실험자를 대상으로 그 차이를 비교분석해보고자 한 연구이다. 이 연구를 위해서 영어문장이 발화되고 녹음되었으며, 피 실험자는 한국인과 원어민 각각 6명씩 참가하였으며, 모두 여성이었고 나이는 23세에서 35세에 위치하고 있다. 음향특질중 하나인 길이측정을 위해서 Praat소프트웨어 프로그램을 활용하였으며, 그 결과를 통계 처리하였다. 실험결과 /eɪ/ 와 /aɪ/에서는 한국인들이 더 길게 발음하였지만 그 차이가 통계상 유의미한 수준은 아니었다. 그러나 /æ/의 발음에서는 한국인들의 발음 길이가 원어민에 비해 훨씬 짧았으며, 그 차이도 통계상 유의미한 수준으로 나타났다.

실시간 임베디드 음성 인식 시스템 (A Real-Time Embedded Speech Recognition System)

  • 남상엽;전은희;박인정
    • 전자공학회논문지CI
    • /
    • 제40권1호
    • /
    • pp.74-81
    • /
    • 2003
  • 본 연구에서는 음성인식 엔진과 데이터베이스에 필요한 메모리 규모를 최소화시킨 실시간 임베디드 음성인식 시스템을 구현하였다. 실험을 위해 PCS 전화기에서 사용하는 40가지의 명령어와 10개의 숫자음으로 구성된 단어 목록을 만들고, 이들 단어들을 남,여 화자가 발성하여 음성 시료를 구했다. 채록된 음성을 대상으로 창크기 256표본외 단기 분석을 통해 선형 예측 계수를 구한다. 이때 고역강조를 통해 직류 성분을 제거하고 성문 등의 저역 필터효과를 제거하였다. 선형 예측 계수는 Levinson-Durbin 알고리즘을 사용해 구했고 이를 다시 켑스트럼 계수로 변환하여 인식을 위한 특징 벡터열로 구축하였다. 각 단어의 특징 벡터 열에 대해 Baum-Welch 추정법을 이용하여 HMM을 훈련시킨 다음, 기능성 계산을 통해 각 단어에 대한 인식을 수행하도록 하였다. 단어 인식을 위해 ARM CPU코어가 장착된 보드에 음성인식 엔진과 데이터 베이스를 포팅하여 실험용 임베디드 시스템을 구축하였다 5가지 인식 계수집단에 대한 인식 실험을 실시하여 인식률이 좋은 계수 집단을 선정하였다. 전체적인 음성인식 엔진의 인식률은 95%이었고 명령어에 대한 인식률은 96%, 숫자음에 대한 인식률은 94%로 나타났다.

External photoglottography, intra-oral air pressure, airflow and acoustic data on the Korean fricatives /s', s/

  • Kim, Hyunsoon;Maeda, Shinji;Honda, Kiyoshi;Crevier-Buchman, Lise
    • 말소리와 음성과학
    • /
    • 제14권3호
    • /
    • pp.11-25
    • /
    • 2022
  • From simultaneous recordings of the external photoglottography, intra-oral air pressure (Pio), airflow and acoustic data from four native Seoul Korean speakers (2 male and 2 female), we have found that the two fricatives are not significantly different in glottal opening peak and airflow peak height either word-initially or word-medially and that the duration of aspiration is significantly reduced in word-medial /s/, compared to those in word-initial /s/, not in /s'/. We have also found that the duration of a high Pio plateau is significantly longer in /s/ than in /s'/ both word-initially and word-medially and that airflow resistance (R=Pio/U) at the onset and offset of a Pio plateau and at the time of airflow peak height is significantly higher in /s'/ than in /s/ across the contexts. However, the differences in Pio peak and F0 are not significant. In addition, the transition time to reach airflow peak height from the offset of a Pio plateau is found to be significantly longer in /s/ than /s'/ in both word-initial and word-medial positions. No significant differences in glottal opening peak and airflow peak height confirm that /s/ is specified as [-spread glottis] like /s'/. As for the other significant differences, we propose that /s/ is [-tense], and /s'/ [+tense].

한국어 /ㅛ/의 발음 양상 연구: 발음형 빈도와 음향적 특징을 중심으로 (Pronunciation of the Korean diphthong /jo/: Phonetic realizations and acoustic properties)

  • 이향원
    • 말소리와 음성과학
    • /
    • 제15권1호
    • /
    • pp.9-17
    • /
    • 2023
  • 이 연구의 목적은 한국어 이중모음 /ㅛ/가 다양한 언어학적 환경에서 어떠한 발음 변이 양상을 보이는지 밝히는 것이다. 특히 음성적 변이와 분포 범위의 연관성에 주목하여 /ㅛ/의 발음 양상을 논의하였다. 서울코퍼스의 여성 화자 10명의 발화에서 나타난 /ㅛ/의 운율적 위치(단음절, 어절 초, 어절 중, 어절 말)와 어휘 부류(내용어, 기능어)를 분석하였다. 각 환경에서 /ㅛ/의 출현 빈도를 파악한 결과, 운율적 위치에 따라 어휘 부류와 발음형 실현이 달라지는 양상을 보였다. 음향 분석을 통해 기능어에서 나타나는 /ㅛ/에서는 음성적 약화가 빈번하게 일어나는 것을 확인하였다. 어휘 부류는 /ㅛ/의 평균적인 음가를 달라지게 하지는 않았지만 개별 토큰의 분포 양상에서는 차이가 발견되었다. 이를 통해 언어학적 환경이 모음의 음성적 분포 양상에 영향을 미친다는 것을 알 수 있었다.