• 제목/요약/키워드: text-to-speech system

검색결과 246건 처리시간 0.042초

Part-of-speech Tagging for Hindi Corpus in Poor Resource Scenario

  • Modi, Deepa;Nain, Neeta;Nehra, Maninder
    • Journal of Multimedia Information System
    • /
    • 제5권3호
    • /
    • pp.147-154
    • /
    • 2018
  • Natural language processing (NLP) is an emerging research area in which we study how machines can be used to perceive and alter the text written in natural languages. We can perform different tasks on natural languages by analyzing them through various annotational tasks like parsing, chunking, part-of-speech tagging and lexical analysis etc. These annotational tasks depend on morphological structure of a particular natural language. The focus of this work is part-of-speech tagging (POS tagging) on Hindi language. Part-of-speech tagging also known as grammatical tagging is a process of assigning different grammatical categories to each word of a given text. These grammatical categories can be noun, verb, time, date, number etc. Hindi is the most widely used and official language of India. It is also among the top five most spoken languages of the world. For English and other languages, a diverse range of POS taggers are available, but these POS taggers can not be applied on the Hindi language as Hindi is one of the most morphologically rich language. Furthermore there is a significant difference between the morphological structures of these languages. Thus in this work, a POS tagger system is presented for the Hindi language. For Hindi POS tagging a hybrid approach is presented in this paper which combines "Probability-based and Rule-based" approaches. For known word tagging a Unigram model of probability class is used, whereas for tagging unknown words various lexical and contextual features are used. Various finite state machine automata are constructed for demonstrating different rules and then regular expressions are used to implement these rules. A tagset is also prepared for this task, which contains 29 standard part-of-speech tags. The tagset also includes two unique tags, i.e., date tag and time tag. These date and time tags support all possible formats. Regular expressions are used to implement all pattern based tags like time, date, number and special symbols. The aim of the presented approach is to increase the correctness of an automatic Hindi POS tagging while bounding the requirement of a large human-made corpus. This hybrid approach uses a probability-based model to increase automatic tagging and a rule-based model to bound the requirement of an already trained corpus. This approach is based on very small labeled training set (around 9,000 words) and yields 96.54% of best precision and 95.08% of average precision. The approach also yields best accuracy of 91.39% and an average accuracy of 88.15%.

음성인식과 자연어 처리 딥러닝을 통한 전자의무기록자동 생성 시스템 (Automatic Electronic Medical Record Generation System using Speech Recognition and Natural Language Processing Deep Learning)

  • 손현곤;류기환
    • 문화기술의 융합
    • /
    • 제9권3호
    • /
    • pp.731-736
    • /
    • 2023
  • 최근 의료 현장은 전자의무기록, 전자건강기록 등의 의료 기록을 전산화하여 저장하고 관리하는 시스템이 의무적으로 적용되거나 전체 의료 현장에 보급되어 환자 개개인의 과거 의료 기록을 추가적인 의료 행위에 활용하고 있다. 그러나 일반적인 의료 문진 및 상담 간 발생하는 의료진과 환자 간의 대화는 별도로 기록되거나 저장되지 않고 있어 추가적인 환자의 주요 정보는 효율적으로 활용되지 못하고 있다. 이에 따라, 의료 문진 현장에서 발생하는 의료진과 환자와의 대화를 저장하고 이를 텍스트 데이터로 변환하여 주요한 문진 내용만 자동으로 추출, 요약하여 정보화하는 음성인식과 자연어 처리 딥러닝을 통한 의료상담 요약문을 자동으로 생성하는 전자의무기록 시스템을 제안한다. 본 시스템은 의료 종사자와 환자의 의료 상담 내용의 인식과정을 거쳐서 텍스트 정보를 획득한다. 이렇게 획득된 텍스트를 복수의 문장으로 구분하고, 생성된 문장에 포함된 복수 키워드의 중요도를 산출한다. 산출된 중요도를 기반으로 복수의 문장에 순위를 매기고, 순위를 기반으로 문장들을 요약하여 최종 전자의무기록 데이터를 생성한다. 제안하는 시스템 성능은 정량적 분석을 통하여 우수함을 확인한다.

콘텐츠 배급을 위한 RSS 기반의 VoiceXML 다이얼로그 시스템 (VoiceXML Dialog System Based on RSS for Contents Syndication)

  • 권형준;김정현;이현구;홍광석
    • 정보처리학회논문지B
    • /
    • 제14B권1호
    • /
    • pp.51-58
    • /
    • 2007
  • 본 논문은 갱신이 잦은 콘텐츠의 배급 및 구독을 위해 등장한 시맨틱 웹의 대표적인 기술인 RSS(RDF Site Summary or Really Simple Syndication)와 인터넷에 존재하는 정보를 음성으로 제공하기 위해 제안된 XML 규격의 W3C 표준 마크업 언어인 VoiceXML을 결합한 시스템의 프로토타입을 제시한다. 제안하는 시스템은 인터넷 기반으로 제공되는 콘텐츠를 유무선 전화망을 통해 음성인식 및 합성기술로 제공하기 위한 것으로서, RSS 서비스를 제공하기 위한 기존의 구성을 수정하지 않고 갱신된 콘텐츠의 구독이 손쉬운 RSS의 장점을 VoiceXML에 적용할 수 있는 특징이 있다. 정보 요청자 측면에서는 RSS로 제공되는 콘텐츠 탐색에 인터넷 환경이 아닌 유무선 전화망을 이용하므로 시공간의 제약을 줄일 수 있으며, 정보 제공자 측면에서는 음성인식 및 합성기술을 이용한 콘텐츠의 배급에 최신 정보의 제공을 위한 별도의 구성요소를 필요로 하지 않는 장점이 있다. 제안하는 시스템의 예로 뉴스 서비스를 구현한 결과, 실제 콘텐츠를 구독하고 탐색할 때에 응답 시간과 음성 인식 측면에서 장애 없이 RSS Feed를 이용해 비주얼 환경으로 제공되는 내용과 동일한 내용을 음성으로 제공받을 수 있었다.

시각장애인용 웹사이트 자동생성 툴 개발 (Development of Automatic Creating Web-Site Tool for the Blind)

  • 백현기;하태현
    • 디지털콘텐츠학회 논문지
    • /
    • 제8권4호
    • /
    • pp.467-474
    • /
    • 2007
  • 본 연구는 시각장애인을 위해 음성 인식, 음성 합성 기술을 이용하여 일반인과 마찬가지로 개인의 특성에 맞는 홈페이지를 구축하게 하는 웹 사이트 자동 생성 툴을 개발 하였다. 이 연구에서 개발한 툴을 이용하여 시각 장애인은 개인 맞춤 정보 생성 기능과 관리기능을 통해 일반인과 의사소통을 원활하게 할 수 있다. 또한 이 툴은 기본적인 명령어를 음성인식으로 처리할 수 있게 지원하며, 음성출력이 지원되는 TTS등을 추가적으로 제공한다. 따라서 본 연구개발의 결과물은 시각장애인들이 사회적 소외감을 없애며, 정보화 시대에 동등한 위치에서 생활 할 수 있도록 하는데 중요한 역할을 할 것이다.

  • PDF

시각 장애인을 위한 Bluetooth 4.0 기반의 실내 위치 추정 및 안내 시스템 (An Indoor Localization and Guidance System for the Visually Impaired Person Based on Bluetooth 4.0)

  • 배선영
    • 한국콘텐츠학회논문지
    • /
    • 제16권8호
    • /
    • pp.202-208
    • /
    • 2016
  • 시각장애인의 활동범위가 늘어나면서 복잡하고 대형화된 건물들 속에서 목적지까지 안전하게 찾아가기란 쉽지 않다. 시각장애인을 위해 GPS 신호나 음성 알림 정보, 점자 유도 블록, 음향 신호기 등을 활용한 안내 시스템이 있지만 이는 대부분 실외 안내 시스템으로 실내에서는 적합하지 않다. 이에 본 논문에서는 보편화된 스마트 폰을 이용하여 시각장애인에게 해당 목적지에 대한 방향, 거리, 높이, 장애물 등의 목적지까지의 다양한 정보를 음성기술인 TTS(Text to Speech)와 촉각기술인 햅틱(Haptic) 그리고 블루투스 4.0기반의 근거리 무선통신 기술인 비콘을 이용하여 사용자에게 알려 줄 수 있는 실내 위치 추정 및 안내 시스템을 제안한다. 제한된 시스템의 실험 결과에서 사용자는 목적지까지의 최적 경로를 검색하여 TTS와 Haptic 기술을 이용해 안전하고 정확하게 안내받을 수 있었다.

T2S(Text-To-Speech) 시스템 구축을 위한 분석 및 설계 (Design and Analysis of T2S System Implementation)

  • 김정형;이왕헌;이현창
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2006년도 추계학술발표대회
    • /
    • pp.713-716
    • /
    • 2006
  • IT 정보 기술 발달로 관련 하드웨어와 스프트웨어의 보급이 일반화 되며, 그에 따라 신체적 장애를 겪고 있는 사람들에게 IT기술을 이용하여 신체적 결함을 극복할 수 있는 정보통신 응용제품은 필수적이다. 특히, 고령화 사회로 접어들면서 신체적 기능저하들 중에서 시각 기능 저하도 대표적인 부분이다. 이러한 시각장애를 겪고 있는 사람들을 위한 정보전달 수단으로 점자책등이 존재한다. 그러나 일반 서적에 비하면 이용 및 활용을 위한 제반 기술이 상당히 부족한 현실이다. 이에 본 연구에서는 시각 장애를 겪는 사람 및 장애자들에게 일반 책을 읽을 수 있도록 오픈 소스 기반에 소형 스캐너를 부착한 웨어러블(wearable) PC를 직접 제작하여 개발 완료시점에 있는 시스템 내용에 관한 분석 및 설계에 관한 내용이다. 이를 위해 본 연구에서 일반 스캐너 내부 구성을 살펴보면, 책 혹은 정자로 주어진 문서를 실시간으로 스캔닝을 통해서 글자를 추출하고, 추출된 글자를 음성으로 들려주는 휴대용 통합시스템(T25:text-to-speech)의 개발 진행된 연구에 관하여 살펴본다.

  • PDF

2D 바코드와 TTS를 활용한 정보접근 임베디드 시스템 구현 (Implementation of information access embedded system using two-dimensional bar code and TTS)

  • 이재균;김시우;이채욱;이동인
    • 대한임베디드공학회논문지
    • /
    • 제1권2호
    • /
    • pp.31-36
    • /
    • 2006
  • As two dimensional bar code can collect data and information quickly, it is used and recognized as a useful tool for the many industrial application field. But the information capacity of two dimensional bar code is still limited. Recently, the two dimensional AD bar code (analog-digital code) that can increase its application range and overcome capacity limitation is developed. In this paper, we implement an effective system which can transform text information into voice using two dimensional AD bar code and TTS(Text To Speech). It can be transmitted to blind people by capturing the AD bar code on the papers or the books.

  • PDF

세밀한 감정 음성 합성 시스템의 속도와 합성음의 음질 개선 연구 (A study on the improvement of generation speed and speech quality for a granularized emotional speech synthesis system)

  • 엄세연;오상신;장인선;안충현;강홍구
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송∙미디어공학회 2020년도 하계학술대회
    • /
    • pp.453-455
    • /
    • 2020
  • 본 논문은 시각 장애인을 위한 감정 음성 자막 서비스를 생성하는 종단 간(end-to-end) 감정 음성 합성 시스템(emotional text-to-speech synthesis system, TTS)의 음성 합성 속도를 높이면서도 합성음의 음질을 향상시키는 방법을 제안한다. 기존에 사용했던 전역 스타일 토큰(Global Style Token, GST)을 이용한 감정 음성 합성 방법은 다양한 감정을 표현할 수 있는 장점을 갖고 있으나, 합성음을 생성하는데 필요한 시간이 길고 학습할 데이터의 동적 영역을 효과적으로 처리하지 않으면 합성음에 클리핑(clipping) 현상이 발생하는 등 음질이 저하되는 양상을 보였다. 이를 보안하기 위해 본 논문에서는 새로운 데이터 전처리 과정을 도입하였고 기존의 보코더(vocoder)인 웨이브넷(WaveNet)을 웨이브알엔엔(WaveRNN)으로 대체하여 생성 속도와 음질 측면에서 개선됨을 보였다.

  • PDF

음성정보 내용분석을 통한 골프 동영상에서의 선수별 이벤트 구간 검색 (Retrieval of Player Event in Golf Videos Using Spoken Content Analysis)

  • 김형국
    • 한국음향학회지
    • /
    • 제28권7호
    • /
    • pp.674-679
    • /
    • 2009
  • 본 논문은 골프 동영상에 포함된 오디오 정보로부터 검출된 이벤트 사운드 구간과 골프 선수이름이 포함된 음성구간을 결합하여 선수별 이벤트 구간을 검색하는 방식을 제안한다. 전체적인 시스템은 동영상으로부터 분할된 오디오 스트림으로부터 잡음제거, 오디오 구간분할, 음성 인식 등의 과정을 통한 자동색인 모듈과 사용자가 텍스트로 입력한 선수 이름을 발음열로 변환하고, 색인된 데이터베이스에서 질의된 선수 이름과 상응하는 음성구간과 연결되는 이벤트 구간을 찾아주는 검색 모듈로 구성된다. 선수이름 검색을 위해서 본 논문에서는 음소 기반, 단어 기반, 단어와 음소를 결합한 하이브리드 방식을 적용한 선수별 이벤트 구간 검색결과를 비교하였다.

경증 자폐성 장애인을 위한 보완·대체의사소통 지원프로그램 (Individual with mild autistic disorder Augmentative and alternative communication Training Program)

  • 유성령;박정화;박수현
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2013년도 추계학술대회
    • /
    • pp.507-509
    • /
    • 2013
  • 본 논문에서는 최근 많은 관심을 받고 있는 안드로이드를 활용한 경증 자폐성장애인을 위한 보완대체의사소통 지원프로그램을 구현하였다. 보완대체의사소통이란 구어 및 비구어적 의사표현하기 어려운 사람들을 위해 사용하는 의사소통체계로서, 본 프로그램에서는 자폐장애인의 의사소통과 의사소통 언어의 선택적 빈도를 측정하는 방법과 자폐 아등의 지적 장애인의 언어에 대한 기본적인 훈련을 하는 방법을 소개한다. 본 논문에서는 보완대체 의사소통에서의 언어표상기법을 활용하여 여러 의사소통의 자유가 없는 사용자들이 효과적인 의사소통 및 학습을 할 수 있도록 개발하였으며, TTS(Text to Speech)를 사용하여 사용자의 의사를 육성으로 전달할 수 있도록 하였다. 그림판기능을 제공하여 사용자의 의사전달의 폭을 넓히고 언어빈도 측정을 통한 사용자의 언어사용빈도 그리고 자폐아의 경우 의식적 무의식 의사전달에 따른 백분율 수치를 두어 도움을 주도록 구현하였다.

  • PDF