통합 검색 | Korea Science

대어휘 음성인식 언어모델링을 위한 텍스트 코퍼스 구축 (Text Corpus Construction for Language Model)

김정세;윤애선;권혁철
- 한국음향학회:학술대회논문집
- /
- 한국음향학회 2002년도 하계학술발표대회 논문집 제21권 1호
- /
- pp.155-158
- /
- 2002
본 논문은 음성정보연구센터에서 추진하고 있는 대용량 텍스트 코퍼스 구축에 관하여 기술한다. 총 3 년 동안 약 3 억$\~$5 억 어절 수집을 목표로 하고 있으며, 주 목적은 대어휘 음성인식용 언어모델링을 위한 통계정보 추출용으로 활용할 예정이다. 1 차년도인 2002 년에 수집할 텍스트의 양은 약 6 천만 어절로 주요 일간지와 방송뉴스를 대상으로 하고 있다. 이 중 2 천만 어절은 띄어쓰기, 철자오류 수정 등을 수동으로 수행하고, 나머지 어절은 자동 검증 툴을 사용하여 오류를 수정하고자 한다. 본 논문에서는 공동 이용 가능한 텍스트 코퍼스의 구축 방안과 구축 시의 고려해야 할 사항들을 제시하고자 한다.
PDF

음성 특징 추출을 위한 스트레인지 어트랙터의 분석 방법 (An Analysis Method of Strange Attractor for the Feature Extraction)

김태식
- 음성과학
- /
- 제9권2호
- /
- pp.147-155
- /
- 2002
In the area of speech processing, raw signals used to be presented into 2D format. However, such kind of presentation methods have limitation to extract characteristics from the signal because of the presentation method. Generally, not much information can be detected from the 2D signal. Strange attractor in the field of chaos theory provides a 3D presentation method. In the area of recognition problem, signal presentation method is very important because good features can be detected from a good presentation. This paper discusses a new feature extraction method that extracts features from a cycle of the strange attractor. A neural network is used to check whether the method extracts suitable features or not. The result shows very good points that can be applied to some areas of signal processing.
PDF

음성 분석 기술을 적용한 대한민국 주연 남자 배우들의 목소리 특징 분석 - 인터뷰 음성을 중심으로 (Voice Characteristics Analysis of Main Male Actors in Korea by Applying Speech Analysis Technologies - Focused on Interview Voices)

조동욱;최지현
- 한국정보처리학회:학술대회논문집
- /
- 한국정보처리학회 2015년도 춘계학술발표대회
- /
- pp.833-836
- /
- 2015
한국영화에 대한 선호도가 이미 국내에서는 외국 영화의 선호도를 넘어선지 오래된 상황이다. 그만큼 내용적으로나 영화의 완성도를 보태주는 CG 기술 등 흥행을 뒷받침 할 수 있는 요소가 충분히 갖추어 졌다는 것이다. 그러나 여기서 주목하지 않을 수 없는 것은 바로 출연 배우들의 연기력이 아닐 수 없다. 이 같은 관점에서 본 논문에서는 우선적으로 우리나라 남자 주연배우들의 인터뷰 속 목소리의 공통점은 무엇이고 이것이 의미하는 바가 무엇인 지에 대해 음성 분석 기술을 통해 이를 정량적, 시각적으로 추출, 분석해 내는 방법을 제시하고자 한다.
https://doi.org/10.3745/PKIPS.y2015m04a.833 인용 PDF

효과적인 감정인식을 위한 음성 특징 벡터 생성 (Generating Speech feature vectors for Effective Emotional Recognition)

심인우;한의환;차형태
- 한국정보처리학회:학술대회논문집
- /
- 한국정보처리학회 2019년도 춘계학술발표대회
- /
- pp.687-690
- /
- 2019
본 논문에서는 효과적인 감정인식을 위한 효과적인 특징 벡터를 생성한다. 이를 위해서 음성 데이터 셋 RAVDESS를 이용하였으며, 그 중 neutral, calm, happy, sad 총 4가지 감정을 나타내는 음성 신호를 사용하였다. 본 논문에서는 기존에 감정인식에 사용되는 MFCC1~13차 계수와 pitch, ZCR, peakenergy 중에서 효과적인 특징을 추출하기 위해 클래스 간, 클래스 내 분산의 비를 이용하였다. 실험결과 감정인식에 사용되는 특징 벡터들 중 peakenergy, pitch, MFCC2, MFCC3, MFCC4, MFCC12, MFCC13이 효과적임을 확인하였다.
https://doi.org/10.3745/PKIPS.y2019m05a.687 인용 PDF

음성을 이용한 화자 검증기 설계 및 구현 (Design and Implementation of Speaker Verification System Using Voice)

지진구;윤성일
- 한국컴퓨터정보학회논문지
- /
- 제5권3호
- /
- pp.91-98
- /
- 2000
본 논문은 음성을 이용하여 개인의 신원을 확인할 수 있는 화자 검증시스템을 설계, 구현하였다. 특징 파라메터로는 선형 예측 계수나 고속 후리에 변환보다 안정적이고 계산량이 적은 장점이 있는 필터뱅크(filterbank)를 사용했으며 추출된 파라메터들을 LBG 알고리즘을 이용하여 각 개인의 코드북을 작성하였다. 작성된 코드북에 의해 특징 파라메터를 벡터양자화하여 얻어진 코드열로 화자 검증의 참조 패턴 및 입력 패턴을 생성, 이들을 동적시간 정합법을 이용하여 유사도를 측정하여 얻어진 유사도와 임계값을 비교하여 음성 의뢰자(client speaker)인지, 사칭자(impostor)인지 결정하는 화자 검증기를 설계, 구현하였다.
PDF

딥 러닝 기반의 API 와 멀티미디어 요소를 활용한 시니어 라이프 데이터 수집 및 상태 분석 (Senior Life Logging and Analysis by Using Deep Learning and Captured Multimedia Data)

김선대;박은수;정종범;구자성;류은석
- 한국방송∙미디어공학회:학술대회논문집
- /
- 한국방송∙미디어공학회 2018년도 하계학술대회
- /
- pp.244-247
- /
- 2018
본 논문에서는 시니어를 위한 라이프 데이터 수집 및 행동분석 프레임 워크를 설명하고, 이의 부분적 구현을 자세히 설명한다. 본 연구는 시니어를 위한 라이프 데이터를 바탕으로 보호자가 없는 시니어를 보살핌과 동시에, 보호자가 미처 인지하지 못하는 시니어의 비정상적인 상태를 분석하여 판단하는 시스템을 연구한다. 먼저, 시니어가 시간을 많이 소요하는 TV 앞 상황을 가정하고, 방영되는 TV 콘텐츠와 TV 카메라를 이용한 시니어의 영상/음성 정보로 이상상태와 감정상태, TV 콘텐츠에 대한 반응과 반응속도를 체크한다. 구체적으로는 딥 러닝 기반의 API 와 멀티미디어 데이터 분석에서 사용되는 오픈 패키지를 바탕으로, 영상/음성의 키 프레임을 추출하여 감정 및 분위기를 분석하고 시니어의 얼굴 표정 인식, 행동 인식, 음성 인식을 수행한다.
PDF

중증 장애우용 음성구동 휠체어를 위한 강인한 음성인식 알고리즘 (Robust Speech Recognition Algorithm of Voice Activated Powered Wheelchair for Severely Disabled Person)

석수영;정현열
- 한국음향학회지
- /
- 제26권6호
- /
- pp.250-258
- /
- 2007
현재의 음성인식 기술은 하드웨어 기술의 발전과 더불어 여러 분야에 응용되고 있지만 음성구동 휠체어와 같은 고신뢰성이 요구되는 응용분야에서는 아직도 그 성능이 불충분하다. 실 환경에서 음성을 통해 안전하게 휠체어를 제어하기 위해서는 도로의 소음 등과 같은 주변잡음의 영향에 의한 음성인식 성능의 저하, 사용자의 기침소리나 숨소리 등과 같은 비음성 입력시의 오동작, 명령어의 불명확한 발성과 일반인과는 다른 발성 속도 및 발성 주파수 등을 고려한 인식시스템이 필요하다. 이를 위하여 본 논문에서는 비음성 입력시의 오동작을 방지하기 위해 인식기의 전처리 단에서 YIN 기본주파수 추출방법을 적용한 후 프레임 별 신뢰도에 기반한 고정도로 음성/비음성을 판별할 수 있는 방법을 제안하고, 불명확한발성에 대한 인식 성능 향상을 위해 화자 적응화 방법 및 개인적인 발성 변이를 표현할 수 있는 다중 후보 단어사전을 구성하여 인식성능 제고를 도모하였다. 잡음이 포함된 실 환경하에서 수집한 데이터를 대상으로 인식실험을 수행한 결과 기존의 켑스트럼 방법에서는 오류 없이 비음성을 찾아내는 재현율은 62%로 나타났으나 본 논문에서 제안한 YIN방법에 기반을 둔 신뢰도 측정방법에서는 95.1%를 나타나 우수한 성능을 나타내었다. 실 환경에서 수집된 2211개의 불명확한 발성을 대상으로 인식실험을 수행한 결과 2000상태 16 혼합수 HMnet 모델을 이용한 경우 인식률이 78.6%로 나타났으나 MAP적응화 방법 및 다중 후보 인식사전을 적용한 결과 99.5%의 인식 성능을 나타내어 제안한 방법의 유효성을 확인할 수 있었다.
https://doi.org/10.7776/ASK.2007.26.6.250 인용 PDF KSCI

CART를 이용한 운율구 추출 및 휴지기간 모델링 (The Modelling of Prosodic Phrasing and Pause Duration using CART)

이상호
- 한국음향학회:학술대회논문집
- /
- 한국음향학회 1998년도 제15회 음성통신 및 신호처리 워크샵(KSCSP 98 15권1호)
- /
- pp.81-86
- /
- 1998
트리 기반 모델링 기법 중 하나인 CART 방법을 이용하여, 운율구 추출과 운율구 사이의 휴지 기간을 모델링 하고자 한다. 모델링을 위한 특징 변수들의 유효성을 실험에 앞서 알아본 후, 생성된 트리들을 해석함으로써 제안하는 특징 변수들이 효과적임을 보인다. 음성 정보를 제외한 문서 정보만을 이용하여 실험한 결과, 운율구 경계 결정 오류율은 14.46% 이었고, 휴지 기간 예측 RMSE 가 132.61 msec 이었다.
PDF

Incremental Neural Network 과 LPCC을 이용한 화자인식 (Speaker Identification using Incremental Neural Network and LPCC)

허광승;박창현;이동욱;심귀보
- 한국지능시스템학회:학술대회논문집
- /
- 한국퍼지및지능시스템학회 2002년도 추계학술대회 및 정기총회
- /
- pp.341-344
- /
- 2002
음성은 화자들의 특징을 가지고 있다. 이 논문에서는 신경망에 기초한 Incremental Learning을 이용하여 화자인식시스템을 소개한다. 컴퓨터를 통하여 녹음된 문장들은 FFT를 거치면서 Frequency 영역으로 바뀌고, 모음들의 특징을 가지고 있는 Formant를 이용하여 모음들을 추출한다. 추출된 모음들은 LPC처리를 통하여 화자의 특성을 가지고 있는 Coefficient값들을 얻는다. LPCC과정과 Vector Quantization을 통해 10개의 특징 점들은 학습을 위한 Input으로 들어가고 화자 수에 따라 증가되는 Hidden Layer와 Output Layer들을 가지고 있는 신경망을 통해 화자인식을 수행한다.

화자 확인을 위한 하이브리드 GMM/SVM 방식에 대한 연구 (Research of Hybrid GMM/SVM Approach for Speaker Verification)

윤유선
- 한국정보처리학회:학술대회논문집
- /
- 한국정보처리학회 2008년도 춘계학술발표대회
- /
- pp.139-140
- /
- 2008
문장 독립 화자 확인에서 SVM을 위한 적응된 GMM을 바탕으로 특징을 추출함으로써 GMM과 SVM 사이의 새로운 접근 방식을 제안한다. 우수한 측정성으로 인해, 적응된 GMM은 SVM 화자 확인을 위한 대규모의 음성 데이터로부터 적은 양의, 전형적인 특징 벡터를 추출해오곤 했다. 이 새로운 접근방식을 사용함으로써, 제안된 화자 확인 시스템은 기존의 GMM-UBM 시스템보다 훨씬 나은 성능을 보였다.
https://doi.org/10.3745/PKIPS.y2008m05a.139 인용 PDF

검색결과 988건 처리시간 0.035초

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

자세히 찾기

이미지 검색 (β)