• 제목/요약/키워드: Lip Reading

검색결과 36건 처리시간 0.019초

상태공유 HMM을 이용한 서브워드 단위 기반 립리딩 (Subword-based Lip Reading Using State-tied HMM)

  • 김진영;신도성
    • 음성과학
    • /
    • 제8권3호
    • /
    • pp.123-132
    • /
    • 2001
  • In recent years research on HCI technology has been very active and speech recognition is being used as its typical method. Its recognition, however, is deteriorated with the increase of surrounding noise. To solve this problem, studies concerning the multimodal HCI are being briskly made. This paper describes automated lipreading for bimodal speech recognition on the basis of image- and speech information. It employs audio-visual DB containing 1,074 words from 70 voice and tri-viseme as a recognition unit, and state tied HMM as a recognition model. Performance of automated recognition of 22 to 1,000 words are evaluated to achieve word recognition of 60.5% in terms of 22word recognizer.

  • PDF

베이지안 분류 기반의 입 모양을 이용한 한글 모음 인식 시스템 (Recognition of Korean Vowels using Bayesian Classification with Mouth Shape)

  • 김성우;차경애;박세현
    • 한국멀티미디어학회논문지
    • /
    • 제22권8호
    • /
    • pp.852-859
    • /
    • 2019
  • With the development of IT technology and smart devices, various applications utilizing image information are being developed. In order to provide an intuitive interface for pronunciation recognition, there is a growing need for research on pronunciation recognition using mouth feature values. In this paper, we propose a system to distinguish Korean vowel pronunciations by detecting feature points of lips region in images and applying Bayesian based learning model. The proposed system implements the recognition system based on Bayes' theorem, so that it is possible to improve the accuracy of speech recognition by accumulating input data regardless of whether it is speaker independent or dependent on small amount of learning data. Experimental results show that it is possible to effectively distinguish Korean vowels as a result of applying probability based Bayesian classification using only visual information such as mouth shape features.

Multimodal audiovisual speech recognition architecture using a three-feature multi-fusion method for noise-robust systems

  • Sanghun Jeon;Jieun Lee;Dohyeon Yeo;Yong-Ju Lee;SeungJun Kim
    • ETRI Journal
    • /
    • 제46권1호
    • /
    • pp.22-34
    • /
    • 2024
  • Exposure to varied noisy environments impairs the recognition performance of artificial intelligence-based speech recognition technologies. Degraded-performance services can be utilized as limited systems that assure good performance in certain environments, but impair the general quality of speech recognition services. This study introduces an audiovisual speech recognition (AVSR) model robust to various noise settings, mimicking human dialogue recognition elements. The model converts word embeddings and log-Mel spectrograms into feature vectors for audio recognition. A dense spatial-temporal convolutional neural network model extracts features from log-Mel spectrograms, transformed for visual-based recognition. This approach exhibits improved aural and visual recognition capabilities. We assess the signal-to-noise ratio in nine synthesized noise environments, with the proposed model exhibiting lower average error rates. The error rate for the AVSR model using a three-feature multi-fusion method is 1.711%, compared to the general 3.939% rate. This model is applicable in noise-affected environments owing to its enhanced stability and recognition rate.

전통타악기를 활용한 즉흥연주가 청각장애 대학생의 스트레스에 미치는 효과 (A Study on the Effect of Traditional Percussion Improvisation to Hearing-Impaired College Students Who are Under Stress)

  • 이은경
    • 인간행동과 음악연구
    • /
    • 제5권2호
    • /
    • pp.41-66
    • /
    • 2008
  • 본 연구는 전통타악기를 활용한 즉흥연주가 청각장애 대학생의 스트레스에 미치는 효과를 알아본 연구로 독순법이 가능한 21~22세의 후천적 청각장애대학생 4명을 선정해 40분의 개별세션과 50분의 그룹세션을 주 1회씩 총 20회기를 진행하였다. 전겸구 김교헌(1991)이 개발한 대학생용 생활스트레스 척도를 개선한 척도를 이용한 양적 자료와 연구자 및 음악치료사 2인의 관찰을 통해 수집한 질적 자료를 이용해 전통 타악기를 활용한 즉흥연주가 청각장애 대학생의 스트레스에 효과적으로 해소되었음을 확인하였다. 결과적으로 본 연구를 통한 양적분석과 기술적인 분석을 볼 때, 청각장애를 가진 대학생들에게도 소리가 중심이 되는 음악이 치료의 도구로 사용될 수 있음이 입증되었고, 대인관계와 생활 속에서 발생하는 스트레스의 대처관리에 음악이 사용될 수 있음이 확인되었다. 또한 이러한 결과는 향후 다양한 연령대의 청각장애인을 대상으로 하는 음악치료연구의 중요성을 시사한다.

  • PDF

HMM(Hidden Markov Model) 기반의 견고한 실시간 립리딩을 위한 효율적인 VLSI 구조 설계 및 FPGA 구현을 이용한 검증 (Design of an Efficient VLSI Architecture and Verification using FPGA-implementation for HMM(Hidden Markov Model)-based Robust and Real-time Lip Reading)

  • 이지근;김명훈;이상설;정성태
    • 한국컴퓨터정보학회논문지
    • /
    • 제11권2호
    • /
    • pp.159-167
    • /
    • 2006
  • 립리딩은 잡음이 있는 환경에서 음성 인식 시스템의 성능 향상을 위한 한 방법으로 제안되었다. 기존의 논문들이 소프트웨어 립리딩 방법을 제안하는 것에 반하여, 본 논문에서는 실시간 립리딩을 위한 하드웨어 설계를 제안한다. 실시간 처리와 구현의 용이성을 위하여 본 논문에서는 립리딩 시스템을 이미지 획득 모듈, 특징 벡터 추출 모듈, 인식 모듈의 세 모듈로 분할하였다. 이미지 획득 모듈에서는 CMOS 이미지 센서를 사용하여 입력 영상을 획득하게 하였고, 특징 벡터 추출 모듈에서는 병렬 블록매칭 알고리즘을 이용하여 입력영상으로부터 특징벡터를 추출하도록 하였고, 이를 FPGA로 코딩하여 시뮬레이션 하였다. 인식 모듈에서는 추출된 특징 벡터에 대하여 HMM 기반 인식 알고리즘을 적용하여 발성한 단어를 인식하도록 하였고, 이를 DSP에 코딩하여 시뮬레이션 하였다. 시뮬레이션 결과 실시간 립리딩 시스템이 하드웨어로 구현 가능함을 알 수 있었다.

  • PDF

한국판 농인 문화적응 척도 개발 및 타당화 연구 (Development and Validation Study for Korean Version of Deaf Acculturation Scale)

  • 음영지;박지은;손선주;엄진섭;손진훈
    • 한국사회복지학
    • /
    • 제66권3호
    • /
    • pp.55-73
    • /
    • 2014
  • 본 연구의 목적은 한국판 농인 문화적응 척도를 개발하는 것이다. Maxwell-McCaw와 Zea(2011)의 농인 문화적응 척도(Deaf Acculturation Scale)를 국내 농인에 적절하게 번안하여 예비문항을 만들었다. 척도는 농문화적응과 청인문화적응, 두 가지 하위척도로 구분하여 농인들의 문화적응을 측정하도록 구성되었다. 최종적으로 농문화적응 하위척도 25문항, 청인문화적응 하위척도 25문항으로 구성된 한국판 농인 문화적응 척도가 개발되었다. 농문화적응 하위척도 4개의 요인, 청인문화적응 하위척도 5개의 요인으로 구성되었다. 개발된 척도의 내적 일관성 계수인 Cronbach's ${\alpha}$는 농문화적응 하위척도가 .93이었고, 청인문화적응 하위척도가 .93로 높은 값을 보였다. 선행연구를 통해 농문화적응과 관련이 있다고 판단된 연령, 청각장애 시기와 장애 급수와의 상관분석을 통해 공존타당도를 검증하였으며, 집단 자아존중감 척도(Collective Self-Esteem Scale)와의 상관분석으로 구성타당도를 검증하였다. 논의에는 본 연구의 의의 및 제한점과 후속 연구 방향을 제시하였다.

  • PDF