• 제목/요약/키워드: 모음구간

검색결과 50건 처리시간 0.024초

음절수와 모음 열을 이용한 한국어 연결 숫자 음성인식 (Connected Korean Digit Speech Recognition Using Vowel String and Number of Syllables)

  • 윤재선;홍광석
    • 정보처리학회논문지A
    • /
    • 제10A권1호
    • /
    • pp.1-6
    • /
    • 2003
  • 본 논문에서는 음절수와 모음 열 정보를 이용한 한국어 연속 숫자 인식을 제안하였다. 제안한 연속 숫자 인식기는 첫 단계로 발성된 연속 숫자 음성에서 음절수와 구간을 추출하고, 두 번째 단계로 모음 열을 인식한다. 이와 같이 인식된 모음 열 정보를 이용하여 인식 후보를 줄이게 된다. 인식후보 모델은 조음효과에 효과적으로 대처할 수 있는 CV(Consonant Vowel), VCCV, VC단위 HMM(Hidden Markov Model)을 사용하여 연속 숫자 음성인식기를 구성하였다. 실험결과 제안된 방법이 조음효과를 효과적으로 대처하고 연결 숫자 인식에 유효함을 확인하였다.

한국어 폐쇄음의 조음장소가 폐쇄구간의 음성학적 길이에 미치는 영향에 관하여 (On the Effects of Places of Articulation of Stops on Their Closure Duration in Korean)

    • 한국음향학회지
    • /
    • 제17권6호
    • /
    • pp.8-13
    • /
    • 1998
  • 본 논문은 Gesturewndcjq 이론에 근거한 폐쇄음의 조음장소와 폐쇄음의 폐쇄구간 길이와의 상관관계에 대한 가설 즉, 연구개음의 폐쇄구간이 양순음이나 치음의 폐쇄구간에 비해 짧을 것이라는 가설을 실험음성학적으로 검증하였다. 본 연구의 결과는 이 가설을 완 전히 뒷받침해주지는 않는 것으로 나타났다. 폐쇄음의 조음방법에 따라 약간의 차이를 보이 긴 하나 세 조음방법 상에서 적어도 양순음과 연구개음의 폐쇄구간 길이에 있어서는 본 연 구가 예측한대로 양순음의 폐쇄구간 길이가 연구개음의 폐쇄구간 길이보다 긴 것으로 나타 났다. 그러나 치음의 경우는 연구개음의 폐쇄구간과 통계적으로 유의한 차이를 보이지 않았 다. 본 논문은 Gesture 이론이 폐쇄음 조음에 있어 폐쇄음 gesture와 주위 모음의 gesture와 의 중첩정도 외에 여러 다른 음성학적 사실들을 동시에 고려할 필요가 있음을 보여주었다. 즉, 폐쇄음 조음시 폐쇄강의 크기, 조음기관의 움직임 속도, 폐쇄강 내 압력 형성에 걸리는 시간, 그리고 폐쇄음 조음시 턱의 높이 등에 대한 고려의 필요성을 제시하였다.

  • PDF

한국어 반음절단위 규칙합성의 개선을 위한 포만트천이의 변경규칙 (An Alteration Rule of Formant Transition for Improvement of Korean Demisyllable Based Synthesis by Rule)

  • 이기영;최창석
    • 한국음향학회지
    • /
    • 제15권4호
    • /
    • pp.98-104
    • /
    • 1996
  • 본 연구에서는 반음절단위 규칙합성에서 연속음성을 합성할 때 조음결합에 의한 천이구간이 없는 반음절의 연결로 접속되어 부자연스러운 합성음이 되는 것을 개선하기 위하여 연쇄모음의 천이구간을 보상하는 방법으로 포만트천이의 변경규칙을 제안하였다. 반음절 단위만으로는 포만트천이가 발생하는 부분을 채울 수 없기 때문에 반음절단위의 음성데이타와 모음의 반음절 단위의 정상부위로부터 세그멘트한 정상모음 42개를 추가하여 데이터베이스를 구축하였으며 포만트를 변경하는 방법으로 포만트합성에서의 공진회로를 이용하였다. 제안한 방법의 타당성을 확인하기 위하여 음성합성시 연쇄모음 부분에 포만트천이의 변경규칙을 적용하여 원음성 및 변경규칙을 적용하지 않은 반음절단위 음성합성방식에 의한 합성음성의 스펙트로그램과 비교하고 MOS 테스트를 실시한 결과 보다 자연스러운 합성음성을 얻을 수 있음을 확인하였다.

  • PDF

음절신호의 음소 분리와 시간-주파수 판별 패턴의 설정 (Phoneme Separation and Establishment of Time-Frequency Discriminative Pattern on Korean Syllables)

  • 류광열
    • 한국통신학회논문지
    • /
    • 제16권12호
    • /
    • pp.1324-1335
    • /
    • 1991
  • 본 논문은 음절을 음소로 분리하고 각각의 특징을 추출하여 음소를 판별할 수 있는 패턴을 설정하는 실험에 관한 연구이다. 음소분리는 피치검출, 각 성문피크펄스의 폭, 포락실, 진폭의 바이어스, 발성시간 등의 파라메타를 적용한다. 최초의 피치는 성문펄스의 폭, 에너지, 정규화와 성문피크의 가변바이어스 등의 변화에 따라 모음 포라선의 봉우리 부분에서 검출, 이를 기준으로 전체의 피치구간을 추적한다. 모음은 포만트 패턴의 유동을 감소시키는 방법과 제2포만트만으로 모음의 판별이 가능함을 제시하며, 피치 고저에 무관한 압축파형을 추정한다. 자음은 포락실, 스펙트럼, 압추파형, 분석방법 등을 발음방법과 음소 상호 영향에서 패턴을 추출한다. 실험결과 모음음소 90%, 초성자음80%, 종성자음 60% 판별된다.

  • PDF

말소리장애 아동이 산출한 이중모음의 음향학적 특성 (Acoustic features of diphthongs produced by children with speech sound disorders)

  • 조윤수;표화영;한진순;이은주
    • 말소리와 음성과학
    • /
    • 제13권1호
    • /
    • pp.65-72
    • /
    • 2021
  • 본 연구의 목적은 말소리장애 아동이 산출하는 이중모음의 특성을 파악하여 평가 및 중재에 활용할 수 있는 기초 자료를 마련하는 것이다. 현재까지 말소리장애 아동의 이중모음 산출 특성에 관한 음향학적 연구는 미비하였다. 이에 말소리장애 아동과 일반 아동을 대상으로 집단 간 이중모음 산출 특성의 차이를 파악하고자 하였다. 이를 위해 각 10명의 만 4-5세 말소리장애와 일반 아동을 대상으로, 무의미 2음절 '이중모음+다'를 모방하도록 하였다. 산출된 이중모음의 활음 구간 내 제1, 2 포먼트 기울기, 포먼트 변화량, 활음 지속시간을 Praat(version 6.1.16)을 이용해 분석하였다. 연구 결과, 두 집단 간 /유/의 F1 기울기에 집단 간 유의한 차이가 있었다. 또한, 말소리장애 아동이 일반 아동에 비해 전반적으로 작은 포먼트 변화량과 더 짧은 활음 지속시간을 보였다. 유의한 포먼트 변화량의 집단 간 차이는 /유, 예/의 F1과 /야, 예/의 F2에서 나타났으며, 유의한 활음 지속시간의 차이는 /유, 예/에서 나타났다. 본 연구의 결과는 말소리장애 아동이 이중모음을 조음하는 범위가 일반 아동보다 상대적으로 작아 그만큼 조음하는데 걸리는 시간이 줄었음을 보여준다. 이러한 점은 말소리장애 아동의 이중모음에 관한 평가와 중재를 할 때 말소리장애 아동의 조음 범위를 고려해야 하며, 이에 음향학적 도구를 활용하는 것이 필요함을 뒷받침한다.

손실 데이터 이론을 이용한 강인한 음성 인식 (Robust Speech Recognition Using Missing Data Theory)

  • 김락용;조훈영;오영환
    • 한국음향학회지
    • /
    • 제20권3호
    • /
    • pp.56-62
    • /
    • 2001
  • 본 논문에서는 손실이 발생하는 상황에서 높은 인식률을 유지하기 위해서 손실 데이터 이론을 음성 인식기에 적용하였다 손실 데이터 이론은 일반적으로 이용되는 통계적 정합 방법인 은닉 마코프 모델 (HMM: hidden Markov model) 중 연속 Gaussian확률 밀도 함수를 이용하여 음성 특징들의 출력 확률을 나타내는 경우에 쉽게 적용할 수 있다는 장점을 갖고 있다. 손실 데이터 이론의 방법 중 계산량이 적고 인식기에 적용이 쉬운 주변화(marginalization)방법을 사용하였으며 특징 벡터의 특정 차수나 시간열의 손실 검출 방법은 음성 신호의 에너지와 주위 배경 잡음의 에너지의 차이가 임계치보다 작게 되는 부분을 찾는 주파수 차감 방법을 이용하였다. 본 논문에서 제안한 손실 영역의 신뢰도 평가는 분석 구간이 모음일 확률을 계산해서 비교적 잉여 정보가 많이 포함된 모음화된 구간의 손실만을 처리하도록 하였다. 제안한 방법을 사용하여 여러 잡음 환경에 대해서 기존의 손실 데이터 처리 방법만을 사용한 경우보다 452 단어의 화자독립 단어 인식 실험을 수행한 결과 오류율측면에서 평균적으로 약 12%의 성능 향상을 얻을 수 있었다.

  • PDF

VCCV단위를 이용한 어휘독립 음성인식 시스템의 구현 (An Implementation of the Vocabulary Independent Speech Recognition System Using VCCV Unit)

  • 윤재선;홍광석
    • 한국음향학회지
    • /
    • 제21권2호
    • /
    • pp.160-166
    • /
    • 2002
  • 본 논문에서는 CV (Consonant Vowel), VCCV (Vowel Consonant Consonant Vowel), VC (Vowel Consonant) 인식 단위를 이용한 새로운 어휘 독립 음성인식 시스템을 구현하였다. 이 인식 단위는 음절의 안정된 모음 구간에서 분할하여 구성했기 때문에 분할이 용이하다. VCCV단위가 존재하지 않을 경우에는 VC와 CV 반음절 모델을 결합하여 대체모델을 구성하였다. 모음군 군집화 (clustering)와 VCCV 모델이 존재하지 않을 경우 대체모델에 결합규칙을 적용하여 제 1후보에서 90.4% (모델 A)에서 95.6% (모델 C)로 5.2%의 인식 성능향상을 가져왔다. 인식실험결과 제 2후보에서 98.8%의 인식률로 제안된 방법이 효율적임을 확인하였다.

음성특성을 이용한 LSP 변환시간 단축에 관한 연구 (A Study on the Reduction of LSP(Line Spectrum Pair) Transformation Time Using the Voice Characteristic)

  • 강은영;민소연;배명진
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2000년도 제13회 신호처리 합동 학술대회 논문집
    • /
    • pp.557-560
    • /
    • 2000
  • LSP 파라미터는 일정한 ,스펙트럼 민감도와 낮은 스펙트럼 왜곡을 보이고 선형보간이 용이하다는 장점을 갖는다. 피러나 LPC 계수를 LSP 파라미터로 변환하는 방법이 복잡하여 계산시간이 많이 소요된다. 기존의 LSP 변환 방법 중 음성 부호화기에 주로 사용되는 Real Root 방법은 근을 구하기 위해 주파수 역을 순차적으로 검색하기 때문에 계산시간이 많이 소요된다. 본 논문에서 제안하는 방법은 음성 특성을 이용하는 것으로, 묵음의 경우는 묵음 구간에서 일정하게 나타나는 LSP 파라미터의 분포 특성을 이용하여 검색하고 유/무성음에 대해서는 LSP 파라미터의 분포도에 따라 검색구간의 순서와 검색간격을 달리한다. 또한, 모음에 대해서는 제1 포만트와 제2 포만트의 연관성을 고려하여 검색구간을 조절한다. 기존의 Real Root 방법과 제안한 방법을 비교한 결과 검색시간이 평균 46.5% 단축되었다.

  • PDF

음성신호의 Jitter 성분의 장시간 변화에 관한 통계적 분석 (Statistical analysis on long-term change of jitter component on continuous speech signal)

  • 조철우
    • 말소리와 음성과학
    • /
    • 제12권4호
    • /
    • pp.73-80
    • /
    • 2020
  • 본 연구에서는 연속음성에서의 장시간 jitter 성분 측정 방법에 대해 고찰하였다. 기존의 jitter측정방법으로는 지속 발성한 모음을 대상으로 변동성을 측정하는 방법을 주로 사용하여왔다. 문장음성 등 연속음성의 경우는 문장에 따른 운율정보의 영향으로 기존의 측정법으로는 왜곡이 발생하게 된다. 이에 연속 발성에 대해 운율정보의 피치 변동을 상쇄시키는 방법을 제안하고자 한다. 피치 변동을 제거하는 방법으로는 분석구간내에서의 피치 변동을 다항식 보간법에 의해 변동 경향을 대표하는 곡선을 구하고 그 곡선을 기준으로 변이를 제거하였다. 이후 변이가 제거된 피치의 궤적으로부터 jitter를 측정하는 방법을 적용하여 피치 주파수의 변동성을 측정하고 기존의 지속모음에 의한 측정 방법과 비교하였다. 제안한 방법의 효용성 측정을 위해 Kay Pentax MEEI DB의 음성 표본을 사용하였다. 통계분석 결과 제안된 방법에 의해 연속음성으로부터 측정한 jitter 값은 동일 화자의 지속모음으로부터 측정한 파라미터 값과 유사한 변동성을 보여 주었다.

영어와 한국어 자연발화 음성 코퍼스에서의 무성 파열음 연구 (A study on the voiceless plosives from the English and Korean spontaneous speech corpus)

  • 윤규철
    • 말소리와 음성과학
    • /
    • 제11권4호
    • /
    • pp.45-53
    • /
    • 2019
  • 본 논문의 목적은 자연발화 음성 코퍼스를 대상으로 영어 무성 파열음 [p, t, k]과 한국어 격음 파열음 [ph, th, kh]의 조음위치 결정에 영향을 미치는 요인들을 살펴보는 것이다. 프랏 스크립트를 이용하여 요인들은 자동 추출하였고, 판별분석을 통해 요인의 수를 점차 증가시켜가면서 무성 파열음의 예측 정확도를 계산하였다. 분석에 사용된 요인들은 개방파열, 파열 후 기식음과 모음 시작 부분의 운동량과 스펙트럼 기울기, 폐쇄구간과 VOT, 단어와 발화 내 위치, 마지막으로 직후 모음의 종류 등이었다. 분석 결과에 따르면, 요인의 수가 다섯 개까지 증가하는 경우 예측정확도가 최대로 증가하여 영어는 74.6%, 한국어는 66.4%를 나타내었다. 그러나 사실상의 최대값에 도달하는 데는 네 개의 요인으로도 충분하였고, 이들은 개방파열과 직후 모음의 운동량과 스펙트럼 기울기, 폐쇄구간과 VOT였다. 이는 무성파열음의 조음위치가 자신의 내부 요인들과 직후 모음의 영향을 동시에 받는다는 것을 의미한다고 볼 수 있다.