• 제목/요약/키워드: Speech Recording

검색결과 97건 처리시간 0.027초

Application of Block On-Line Blind Source Separation to Acoustic Echo Cancellation

  • Ngoc, Duong Q.K.;Park, Chul;Nam, Seung-Hyon
    • The Journal of the Acoustical Society of Korea
    • /
    • 제27권1E호
    • /
    • pp.17-24
    • /
    • 2008
  • Blind speech separation (BSS) is well-known as a powerful technique for speech enhancement in many real world environments. In this paper, we propose a new application of BSS - acoustic echo cancellation (AEC) in a car environment. For this purpose, we develop a block-online BSS algorithm which provides robust separation than a batch version in changing environments with moving speakers. Simulation results using real world recordings show that the block-online BSS algorithm is very robust to speaker movement. When combined with AEC, simulation results using real audio recording in a car confirm the expectation that BSS improves double talk detection and echo suppression.

Voice-based Device Control Using oneM2M IoT Platforms

  • Jeong, Isu;Yun, Jaeseok
    • 한국컴퓨터정보학회논문지
    • /
    • 제24권3호
    • /
    • pp.151-157
    • /
    • 2019
  • In this paper, we present a prototype system for controlling IoT home appliances via voice-based commands. A voice command has been widely deployed as one of unobtrusive user interfaces for applications in a variety of IoT domains. However, interoperability between diverse IoT systems is limited by several dominant companies providing voice assistants like Amazon Alexa or Google Now due to their proprietary systems. A global IoT standard, oneM2M has been proposed to mitigate the lack of interoperability between IoT systems. In this paper, we deployed oneM2M-based platforms for a voice record device like a wrist band and LED control device like a home appliance. We developed all the components for recording voices and controlling IoT devices, and demonstrate the feasibility of our proposed method based on oneM2M platforms and Google STT (Speech-to-Text) API for controlling home appliances by showing a user scenario for turning the LED device on and off via voice commands.

마비성구어장애 화자의 조음밸브 교호운동에 관한 공기역학 및 음향학적 특징 (A Study on the Aerodynamic and Acoustic Characteristics in Dysarthria Speakers' Diadochokinesis by Articulation Valves in Vocal Tract)

  • 박희준;권순복;왕수건;정옥란
    • 음성과학
    • /
    • 제15권2호
    • /
    • pp.177-189
    • /
    • 2008
  • This study was to investigate diadochokinetic (DDK) rate, regularity and mean flow rate of articulation valves in dysarthria. DDK rate, mean airflow rate (MFR) and regularity of DDK syllable repetitions of vocal function /ihi/, tongue function /ta/, velopharyngeal function /bm/, and labial function /pa/ in 24 normal and dysarthric speakers were measured. Aerophone Ⅱ and Motor Speech Profile were used for data recording and analysis. The results of the findings were as follows: First, there were significant differences between the dysarthria and the normal group in DDK rate. DDK rates in ataxic dysarthria were the lowest and spastic, flaccid, and hypokinetic dysarthria followed in sequence. Second, there was a significant difference between the dysarthria and the normal group in DDK regularity. Third, there was a significant difference between dysarthria groups and normal group in DDK MFR. Finally, there was a significant difference between the 4 groups of dysarthria and the normal group in DDK air flow tracking. The results of this study can be guidelines for normal DDK rate, regularity and flow rate in dysarthria groups. In addition, their differential diagnoses and descriptions are important to make a decision on medical and behavioral management of the individuals with disorders according to DDK characteristics.

  • PDF

교합장치가 발음시 하악위 및 하악의 비틀림 회전운동에 미치는 영향 (Effects of Occlusal Appliance on the Mandibular Position and the Mandibular Rotational Torque Movement during Speech)

  • 김문규;한경수;김종영;양근영
    • Journal of Oral Medicine and Pain
    • /
    • 제26권1호
    • /
    • pp.59-73
    • /
    • 2001
  • This study was performed to investigate the effects of occlusal appliance on the mandibular position and the mandibular rotational torque movement during speech. For this study, 20 patients with temporomandibular disorders(TMDs) and 20 normal subjects without any signs and symptoms in the masticatory system were selected as the patient group and as the normal group, respectively. Biopak $system^{(R)}$(Bioresearch Inc., Milwaukee, USA) and a sentence of 'Sue is missing her house' were used for recording and for observing of speech pattern. There were five mandibular positions observed in this study, that is, mandibular rest position, 'ssi', 'her', 'ha', and 's' speech position. In each position, slant and A-P distance in sagittal plane, vertical distance and lateral distance in frontal plane were measured. Amount of the mandibular rotational torque movement were measured at 'her', 'ha' speech position and for all through speech movement. Centric relation splint(CRS) was placed in both groups, but anterior or posterior bite plane were placed in normal subjects only. Data collected were processed and analysed by SPSS windows program. The results of this study were as follows : 1. Mandibular positions in both groups were not different before adaptation, with CRS, and after removal, but total amount of the mandibular rotational torque movement was greater in patients. 2. Mandible was slightly placed anteriorly with CRS at 'her' and 'ha' speech position in patients, but was placed anteriorly at all the five positions in normal subjects. 3. Difference with type of occlusal appliance in normal subjects were noted only for vertical distance at 'ssi' and 'ha' speech position, and the distance with CRS were more than that with posterior bite plane. 4. Mandibular rotational torque movement at 'her' and 'ha' speech position was greater in patients, but the difference was disappeared after appliance removal. And the torque movement was greater at 'ha' speech position than that at 'her' speech position in frontal plane. It could be concluded that the adaptation of occlusal appliance showed a tendency to locate the mandible anteriorly during speech in both groups, but did not affect total mandibular rotational torque movement which was greater in patients.

  • PDF

자질 선택 기법을 이용한 한국어 화행 결정 (Decision of the Korean Speech Act using Feature Selection Method)

  • 김경선;서정연
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제30권3_4호
    • /
    • pp.278-284
    • /
    • 2003
  • 화행(speech act)이란 화자의 발화를 통해 나타나는 화자의 의도를 가르키며 자연어로 된 발화를 이해하고 이에 대한 응답을 생성하기 위해 중요한 요소이다. 본 논문에서는 한국어 화행 결정의 성능을 높이기 위해 두 단계 방법을 제안한다. 첫 번째 단계는 형태소 분석결과만을 이용하여 추출된 문장자질과 이전 화행을 이용하여 추출된 문맥자질 중 정보량이 높은 자질을 선택하는 단계이다. 이 단계에서는 형태소 분석 시스템을 사용하여 전체 자질을 구성하고 문서분류 분야의 자질 선택에서 높은 성능을 보인 카이제곱 통계량을 이용하여 효과적인 자질 선택한다. 두 번째 단계는 선택된 자질과 신경망을 이용하여 화행을 분석하는 단계이다. 본 논문에서 제시한 방법은 형태소 분석 결과만을 이용하여 자동적으로 화행을 결정할 수 있는 가능성을 제시하였으며 효과적인 자질 선택을 통해 자질의 수를 감소시키고 정보량이 높은 자질을 사용하여 속도와 성능을 향상 시켰다 본 논문은 제안된 시스템을 실제 영역에서 수집되어 전사된 10,285개의 발화와 17개의 화행으로 이루어진 대화 코퍼스에 대해 실험하였다. 본 논문은 이 코퍼스에서 8,349개 발화를 학습 코퍼스로 사용하여, 실험 코퍼스의 1,936개 발화에 대해 1,709개에 대해 정확한 화행을 제시하여, 88.3%의 정확도를 보였다. 이는 자질 선택을 하지 않았을 때 보다 약 8%가 증가된 결과이다.

음성인식을 위한 혼돈시스템 특성기반의 종단탐색 기법 (A New Endpoint Detection Method Based on Chaotic System Features for Digital Isolated Word Recognition System)

  • 장한;정길도
    • 전자공학회논문지SC
    • /
    • 제46권5호
    • /
    • pp.8-14
    • /
    • 2009
  • 음성 인식 연구에서 잡음이 있는 상태에서 음성 발음상의 시작점과 종단점을 찾는 것은 매우 중요하다. 기존 음성인식 시스템의 오차는 대부분 참고템플릿의 시작점과 종단점을 왜란이나 잡음으로 인해 자동적으로 찾지 못했을 경우 발생한다. 따라서 음성 신호상에서 필요 없는 부분을 제거할 수 있는 방법이 필요하다. 기존의 음성 종단점을 찾는 방법으로는 시간도메인 측정방법, 미세시간 에너지 분석, 영교차율 방법이 있다. 위의 방법들은 저주파 신호 노이즈의 영향에 정밀성을 보장을 못한다. 따라서 본 논문에서는 시간영역상에서 리야프노프 지수를 이용한 종단점 인식 알고리즘을 제안하였다. 기존의 방법들과의 비교를 통해 제안한 방법의 성능 우수성을 보였으며, 시뮬레이션 및 실험을 통해 잡음환경에서도 음성종단 인식이 가능함을 보였다.

x-vector를 이용한 다화자 음성합성 시스템 (A Multi-speaker Speech Synthesis System Using X-vector)

  • 조민수;권철홍
    • 문화기술의 융합
    • /
    • 제7권4호
    • /
    • pp.675-681
    • /
    • 2021
  • 최근 인공지능 스피커 시장이 성장하면서 사용자와 자연스러운 대화가 가능한 음성합성 기술에 대한 수요가 증가하고 있다. 따라서 다양한 음색의 목소리를 생성할 수 있는 다화자 음성합성 시스템이 필요하다. 자연스러운 음성을 합성하기 위해서는 대용량의 고품질 음성 DB로 학습하는 것이 요구된다. 그러나 많은 화자가 발화한 고품질의 대용량 음성 DB를 수집하는 것은 녹음 시간과 비용 측면에서 매우 어려운 일이다. 따라서 각 화자별로는 소량의 학습 데이터이지만 매우 많은 화자의 음성 DB를 사용하여 음성합성 시스템을 학습하고, 이로부터 다화자의 음색과 운율 등을 자연스럽게 표현하는 기술이 필요하다. 본 논문에서는 화자인식 기술에서 사용하는 딥러닝 기반 x-vector 기법을 적용하여 화자 인코더를 구성하고, 화자 인코더를 통해 소량의 데이터로 새로운 화자의 음색을 합성하는 기술을 제안한다. 다화자 음성합성 시스템에서 텍스트 입력에서 멜-스펙트로그램을 합성하는 모듈은 Tacotron2로, 합성음을 생성하는 보코더는 로지스틱 혼합 분포가 적용된 WaveNet으로 구성되어 있다. 학습된 화자 임베딩 신경망에서 추출한 x-vector를 Tacotron2에 입력으로 추가하여 원하는 화자의 음색을 표현한다.

웹툰에 나타난 특징적 말칸 연출에 대한 분석 (The Analysis for the Distinctive Directing of Speech Balloons in Webtoon)

  • 정규하;윤기헌
    • 만화애니메이션 연구
    • /
    • 통권36호
    • /
    • pp.393-416
    • /
    • 2014
  • 만화의 구성요소는 칸, 칸새, 말칸(말풍선)이다. 말칸은 청각적 요소가 완전히 배제된 회화나 청각적 요소를 적극적으로 내포하고 있는 영화, 애니메이션에서는 나타나지 않는 만화만의 특징적인 요소이다. 그러함에도 불구하고 만화의 연구대상에서 말칸은 소외되어 왔던 것이 사실이다. 몇 안되는 선행연구들에서는 말칸의 형태적 특징과 기능에 대해 분명하게 짚고 있다. 웹툰이 일반화된 현재의 시점에도 이러한 말칸의 특징과 기능들이 그대로 계승되어 사용되어지고 있다. 다만 웹의 환경적인 요소가 만화 연출 전반에 걸쳐 변화를 유도한 부분이 있기 때문에 말칸에도 그 영향이 미치고 있다는 것을 알 수 있다. 웹툰에 나타나는 말칸의 특징으로 분류할 만한 관점은 두 가지로 첫째는 말칸의 배치 문제이다. 웹 공간의 무한확장성은 만화의 칸새를 넓게 활용하는데 용이한 환경을 제공해주고 있다. 그에 따라 말칸도 영향을 받아 그 특징을 이용해서 배치하는 경향이 일정부분 나타나고 있다. 이를 분류해 보면 일반 배치형, 외곽 배치형, 상하 배치형, 스크롤 활용형으로 그 특징을 분류할 수 있다. 이러한 경향은 세로스크롤을 활용해 읽어 들어가는 가독방식에 의해 결정되는 것이다. 둘째는 형태적인 문제로 웹툰의 제작 기법이 디지털화되면서 나타나는 다양한 표현방법에 따라 그만큼 말칸 자체의 형태적 표현의 폭이 넓어진 특징이 있다. 그 외 제작형태에 따라 '칸 외 배치형', '칸 내 배치형'이 존재한다. 이러한 경향은 원고 제작에 있어서 출판형태의 원고를 제작한 뒤 여러 매체에 맞는 연출로 편집하기 때문에 나타나는 현상이다. 편집 시에 매체의 특성을 활용하느냐 원본의 이미지를 그대로 고수하느냐의 판단에 따라 달리 표현되는 것이다. 만화는 본질적인 속성을 유지하면서 각 매체의 특성에 따라 변화되어 적용되는 부분들이 생겨나고 있다. 또한 앞으로도 생겨날 매체의 특성에 따라 그 모습을 변화해 갈 것이다. 기존의 선행연구에 새로이 나타나는 현상에 대해 분석하고 분류하여 기록하는 일은 가치 있는 일이 될 것이고 후행연구의 초석이 될 것이다.

언어장애인의 스마트스피커 접근성 향상을 위한 개인화된 음성 분류 기법 (Personalized Speech Classification Scheme for the Smart Speaker Accessibility Improvement of the Speech-Impaired people)

  • 이승권;최우진;전광일
    • 스마트미디어저널
    • /
    • 제11권11호
    • /
    • pp.17-24
    • /
    • 2022
  • 음성인식 기술과 인공지능 기술을 기반으로 한 스마트스피커의 보급으로 비장애인뿐만 아니라 시각장애인이나 지체장애인들도 홈 네트워크 서비스를 연동하여 주택의 전등이나 TV와 같은 가전제품을 음성을 통해 쉽게 제어할 수 있게 되어 삶의 질이 대폭 향상되었다. 하지만 언어장애인의 경우 조음장애나 구음장애 등으로 부정확한 발음을 하게 됨으로서 스마트스피커의 유용한 서비스를 사용하는 것이 불가능하다. 본 논문에서는 스마트스피커에서 제공되는 기능 중 일부 서비스를 대상으로 언어장애인이 이용할 수 있도록 개인화된 음성분류기법을 제안한다. 본 논문에서는 소량의 데이터와 짧은 학습시간으로도 언어장애인이 구사하는 문장의 인식률과 정확도를 높여 스마트스피커가 제공하는 서비스를 실제로 이용할 수 있도록 하는 것이 목표이다. 본 논문에서는 ResNet18 모델을 fine tuning하고 데이터 증강과 one cycle learning rate 최적화 기법을 추가하여 적용하였으며, 실험을 통하여 30개의 스마트스피커 명령어 별로 10회 녹음한 후 3분 이내로 학습할 경우 음성분류 정확도가 95.2% 정도가 됨을 보였다.

실내 흡음에 따른 양이간 음량차가 강의실의 음성명료도에 미치는 영향 (Effect of the Inter-aural Level Differences on the Speech Intelligibility Depending on the Room Absorption in Classrooms)

  • 박찬재;한찬훈
    • 한국음향학회지
    • /
    • 제32권4호
    • /
    • pp.335-345
    • /
    • 2013
  • 본 논문은 교실 및 회의실과 같은 소규모 공간에서 건축 마감재료에 의해 발생할 수 있는 좌우귀의 음량 차이가 사람의 청각적 음성명료도에 미치는 영향에 대하여 규명하고자 하였다. 이를 위해 대학교 강의실의 좌,우 측벽에 흡음재를 설치하였으며, 양이 녹음 시스템을 이용하여 좌측귀와 우측귀의 음압레벨을 각각 측정하였다. 또한 흡음재를 설치하기 전과 후 강의실에서 정상 청력의 대학생 20명을 대상으로 음절테스트를 수행하여 양이간 음량차이에 따른 음성명료도를 조사하였다. 그 결과 측벽에 흡음재를 설치 한 후 벽체에 가까워질수록 양이간 음량차가 크게 발생한다는 점을 알 수 있었으며 일부 수음점에서는 최소변화감지폭인 3 dB 이상 차이가 발생하는 곳도 있었다. 또한 측정점별 양이간 음량차와 음절테스트 점수의 상관관계를 분석한 결과 상관관계 계수가 약 -0.441로 유의한 결과를 나타내었다. 따라서 양이간 음량차가 강의실의 음성명료도에 영향을 미칠 수 있음을 알 수 있었다.