• 제목/요약/키워드: Vocabulary System

검색결과 288건 처리시간 0.027초

대용량 연속 음성 인식 시스템에서의 코퍼스 선별 방법에 의한 언어모델 설계 (A Corpus Selection Based Approach to Language Modeling for Large Vocabulary Continuous Speech Recognition)

  • 오유리;윤재삼;김홍국
    • 대한음성학회:학술대회논문집
    • /
    • 대한음성학회 2005년도 추계 학술대회 발표논문집
    • /
    • pp.103-106
    • /
    • 2005
  • In this paper, we propose a language modeling approach to improve the performance of a large vocabulary continuous speech recognition system. The proposed approach is based on the active learning framework that helps to select a text corpus from a plenty amount of text data required for language modeling. The perplexity is used as a measure for the corpus selection in the active learning. From the recognition experiments on the task of continuous Korean speech, the speech recognition system employing the language model by the proposed language modeling approach reduces the word error rate by about 6.6 % with less computational complexity than that using a language model constructed with randomly selected texts.

  • PDF

신사복 재킷디자인의 감성 및 형상 데이터베이스를 이용한 제품검색 시스템 개발에 관한 연구 (The Development of a System for Product Search Using a Sensibility and Configuration Database on Designing Men's Jackets)

  • 박윤아
    • 대한가정학회지
    • /
    • 제44권4호
    • /
    • pp.133-144
    • /
    • 2006
  • The contemporary period is called "the age of sensibility" in which each individual consumer seeks to have her or his own products. Businesses are in need of design developments with an emphasis on customer sensitivity, and at the same time consumers must understand their own sensitivity to acquire information on designs that suit them. This research established a sensitivity and configuration database on designing men's jackets using the sensitivity engineering approach to clothing design information. The user interface was created on the Internet. Sixty-seven sensitivity terms of vocabulary appropriate for the assessment of men's jacket design were selected, and the different designs were classified into six items and 24 categories. Thirty men's jackets with different designs were produced for sensory testing and the results were analyzed in accordance with general linear I statistics. A sensitivity database was established for each category. My-sql, PHP, Java Script, and Html were used for the configuration database work. The configuration of items/categories, with the most appropriate sensitivity database information assigned to the selected sensitivity vocabulary, was programmed for display on the computer screen. The sensitivity vocabulary of a customer's choice for each factor was selected for the program to run, while the category and product configuration of the men's jacket most suitable for the search was displayed based on the user interface.

테크놀로지에 의한 건축형태 표현특성에 관한 연구 - 현대의 연구소 건축을 중심으로 - (A Study on the Design Characteristics of Technology in the Institute Facilities - Focused on the Modern Institute Facilities -)

  • 김환식;이정수;송용호
    • 한국실내디자인학회논문집
    • /
    • 제14권3호
    • /
    • pp.139-146
    • /
    • 2005
  • This paper focuses on the response of architectural form to the technological characteristics in the institute facilities. For this, we study the meaning of technology in the aspect of physical, formal and social concepts and their architectural expression and sort by grouping through analyzing 27 cases of foreign current Institute facilities. Conclusions can be summarized as followings: 1) Vocabulary of technology in physical concept is presented by the environmental control through the experimental surface such as louver and glazing and the independent exposed equipment. 2) Vocabulary of technology in physical concept is presented using the machine like aesthetics by exposing the structural members and designing the exterior form using dynamical images. 3) The expression of social meaning in technology is presented by standardization, parts assembling through mass production system, the unit material for expression of today's industrial society. The expressions of technological language in the institute facilities are used not only one vocabulary but comprehensive ones.

Improving methods for normalizing biomedical text entities with concepts from an ontology with (almost) no training data at BLAH5 the CONTES

  • Ferre, Arnaud;Ba, Mouhamadou;Bossy, Robert
    • Genomics & Informatics
    • /
    • 제17권2호
    • /
    • pp.20.1-20.5
    • /
    • 2019
  • Entity normalization, or entity linking in the general domain, is an information extraction task that aims to annotate/bind multiple words/expressions in raw text with semantic references, such as concepts of an ontology. An ontology consists minimally of a formally organized vocabulary or hierarchy of terms, which captures knowledge of a domain. Presently, machine-learning methods, often coupled with distributional representations, achieve good performance. However, these require large training datasets, which are not always available, especially for tasks in specialized domains. CONTES (CONcept-TErm System) is a supervised method that addresses entity normalization with ontology concepts using small training datasets. CONTES has some limitations, such as it does not scale well with very large ontologies, it tends to overgeneralize predictions, and it lacks valid representations for the out-of-vocabulary words. Here, we propose to assess different methods to reduce the dimensionality in the representation of the ontology. We also propose to calibrate parameters in order to make the predictions more accurate, and to address the problem of out-of-vocabulary words, with a specific method.

A Study on Image Recommendation System based on Speech Emotion Information

  • Kim, Tae Yeun;Bae, Sang Hyun
    • 통합자연과학논문집
    • /
    • 제11권3호
    • /
    • pp.131-138
    • /
    • 2018
  • In this paper, we have implemented speeches that utilized the emotion information of the user's speech and image matching and recommendation system. To classify the user's emotional information of speech, the emotional information of speech about the user's speech is extracted and classified using the PLP algorithm. After classification, an emotional DB of speech is constructed. Moreover, emotional color and emotional vocabulary through factor analysis are matched to one space in order to classify emotional information of image. And a standardized image recommendation system based on the matching of each keyword with the BM-GA algorithm for the data of the emotional information of speech and emotional information of image according to the more appropriate emotional information of speech of the user. As a result of the performance evaluation, recognition rate of standardized vocabulary in four stages according to speech was 80.48% on average and system user satisfaction was 82.4%. Therefore, it is expected that the classification of images according to the user's speech information will be helpful for the study of emotional exchange between the user and the computer.

대어휘 음성인식을 위한 의사형태소 분석 시스템의 구현 (Implementation of A Morphological Analyzer Based on Pseudo-morpheme for Large Vocabulary Speech Recognizing)

  • 양승원
    • 한국산업정보학회논문지
    • /
    • 제4권2호
    • /
    • pp.102-108
    • /
    • 1999
  • 교착어인 한국어를 대상으로 대용량의 대화체 어휘를 포함하는 연속 음성을 인식하는 데에는 인식단위를 결정하는 것이 매우 중요하다. 본 논문에서는 어절이나 형태소를 사용하는 기존의 음성인식 시스템에서의 난점을 해소하고 새로운 인식단위인 의사형태소를 제안하고, 입력되는 문장을 의사 형태소 단위로 분석하는 형태소 분석기와 태거를 구현하였다. 의사형태소를 이용한 음성인식/합성은 어절이나 형태소단위의 음성인식/합성에서 보다 개선된 결과를 얻을 수 있게 해주며, 인식의 출력을 인식의 다음 단계인 언어처리부의 처리단위와 일치시킬 수 있으므로 전체적인 음성언어 번역시스템의 성능도 높일 수 있다. 본 논문에서 구현한 시스템은 일반 형태소를 대상으로 하는 시스템과 동일한 수준의 성능을 보였다.

  • PDF

언어 장애인의 언어보조 시스템을 위한 아이콘 언어의 구현 (Implementation of Iconic Language for the Language Support System of the Language Disorders)

  • 추교남;우요섭;민홍기
    • 정보처리학회논문지B
    • /
    • 제13B권4호
    • /
    • pp.479-488
    • /
    • 2006
  • 언어 장애인에게 기존의 키보드에 의한 문자입력 방법보다 원활하고 편리한 의사전달 환경을 제공하기 위한 아이콘 언어 인터페이스를 설계한다. 이를 위하여 활용성이 높은 대화 영역으로부터 구축한 원시 말뭉치를 대상으로 어휘 구사 경향과 특성을 분석하고 형태소, 구문, 의미 분석을 적용하여 아이콘에 부여되는 한국어의 어휘와 의미를 추출한다. 사용자가 직관적으로 인지하고 전달할 수 있는 아이콘 영역을 선별하고 추출한 한국어의 어휘와 의미를 정합시킨다. 이웃하는 아이콘간의 연결로부터 전달하고자 하는 의미적 상황을 만들어내기 위하여, 아이콘 언어의 어휘와 품사, 문법 규칙, 의미체계를 정의하여 아이콘 언어를 설계한다. 아이콘 언어에서 나타날 수 있는 언어적 애매성을 해결하기 위한 방법으로 범용의 한국어 의미사전과 술어 중심의 하위범주화사전으로부터 아이콘 언어에 대한 상황중심의 의미 데이터를 구축한다. 이를 바탕으로 아이콘 언어 인터페이스로부터 한국어를 의미적인 범주에서 생성한다.

EPCIS 국제물류 비즈니스 프로세스 이벤트 기술을 위한 어휘 정의 (Vocabulary Definition for Describing Business Process Events of International Logistics on EPCIS)

  • 이선영;배우식;이종연
    • 한국산학기술학회논문지
    • /
    • 제10권2호
    • /
    • pp.334-344
    • /
    • 2009
  • EPCglobal 네트워크는 EPC(Electronic Product Code)와 RFID(Radio Frequency Identification) 기술을 바탕으로 제품에 식별번호를 부여하고 정보를 저장할 수 있는 공간을 네트워크로 연동하여 공급자, 수요자, 소비자가 제품에 관련된 정보를 알 수 있게 해주는 시스템이다. 또한 EPCglobal 아키텍처 프레임워크는 EPC를 사용하여 공급과 유통망 강화라는 업체간의 공동 목표를 위한 서비스하는 것이다. 국내 수출입 물류와 관련하여 기 구축된 물류정보 인프라를 활용하면서 RFID 환경 하에서의 수출입 물류 프로세스의 정의와 각 거점별 용어의 정의가 필요하다. 따라서 이 논문은 EPCglobal 네트워크 프레임 아키텍처의 이벤트 정의 시 사용될 표준 어휘를 제공하고, XML 구현을 통해 실제 사용 가능한 환경을 지원할 것이다. 그러므로 정의된 어휘는 EPCglobal 네트워크의 사건 기술과 XML 구현을 통한 실질적으로 사용 가능한 플랫폼 제공에 기여할 것으로 기대된다.

GMM 음소 단위 파라미터와 어휘 클러스터링을 융합한 음성 인식 성능 향상 (Speech Recognition Performance Improvement using a convergence of GMM Phoneme Unit Parameter and Vocabulary Clustering)

  • 오상엽
    • 융합정보논문지
    • /
    • 제10권8호
    • /
    • pp.35-39
    • /
    • 2020
  • DNN은 기존의 음성 인식 시스템에 비해 에러가 적으나 병렬 훈련이 어렵고, 계산의 양이 많으며, 많은 양의 데이터 확보를 필요로 한다. 본 논문에서는 이러한 문제를 효율적으로 해결하기 위해 GMM에서 모델 파라메터를 가지고 음소별 GMM 파라메터를 추정하여 음소 단위를 생성한다. 그리고 이를 효율적으로 적용하기 위해 특정 어휘에 대한 클러스터링을 통해 성능을 향상시키기 위한 방법을 제안한다. 이를 위해 3가지 종류의 단어 음성 데이터베이스를 이용하여 DB를 가지고 어휘 모델을 구축하였고, 잡음 처리는 워너필터를 사용한 특징을 추출하여 음성 인식실험에 사용하였다. 본 논문에서 제안한 방법을 사용한 결과 음성 인식률에서 97.9%의 인식률을 나타내었다. 본 연구에서 개선된 오버피팅의 문제점을 향상시킬 수 있는 추가적인 연구를 필요로 한다.

전문데이터베이스의 특성과 정보검색성능 (On the Characteristics and Information Retrieval Performance of Full-Text Databases)

  • 조명희
    • 한국문헌정보학회지
    • /
    • 제17권
    • /
    • pp.339-366
    • /
    • 1989
  • Appearance of full-text online is the most encouraging phenomenon ·during the development of databases. The full-text databases of today is derived from by-product of electronic publication of printed materials. Now, there are also some movements toward electronic production of documents in Korea although not powerful. The present study is designed to examine the characteristics and effective retrieval method of full-text databases now commercially available through various vendors. The outline of this paper IS as follows: First, background and present situation of existing full-text database services through national and worldwide are examined. Second, free-text searching system of full-text databases is compared with controlled vocabulary system. The factors influencing on free-text retrieval performance, searching thesaurus, and hybrid or compromising system, which is using limited controlled vocabulary in conjunction with natural language for the enrichment needed for practical operation of the . system, are examined. Third, user demands through the analysis of preceding studies on 'various types of full-text databases are recognised. Fouth, application of CD-ROM full-text database to the libraries and information centers is examined as prospective resources for them. Finally, some problems and prospect of full-text databases are presented.

  • PDF