• 제목/요약/키워드: Statistical Word Comparison

검색결과 9건 처리시간 0.022초

단어 중의성 해소를 위한 지도학습 방법의 통계적 자질선정에 관한 연구 (A Study on Statistical Feature Selection with Supervised Learning for Word Sense Disambiguation)

  • 이용구
    • 한국비블리아학회지
    • /
    • 제22권2호
    • /
    • pp.5-25
    • /
    • 2011
  • 이 연구는 지도학습 방법을 이용한 단어 중의성 해소가 최적의 성능을 가져오는 통계적 자질선정 방법과 다양한 문맥의 크기를 파악하고자 하였다. 실험집단인 한글 신문기사에 자질선정 기준으로 정보획득량, 카이제곱 통계량, 문헌빈도, 적합성 함수 등을 적용하였다. 실험 결과, 텍스트 범주화 기법과 같이 단어 중의성 해소에서도 자질선정 방법이 매우 유용한 수단이 됨을 알 수 있었다. 실험에 적용한 자질선중 기준 중에 정보획득량이 가장 좋은 성능을 보였다. SVM 분류기는 자질집합 크기와 문맥 크기가 클수록 더 좋은 성능을 보여 자질선정에 영향을 받지 않았다. 나이브 베이즈 분류기는 10% 정도의 자질집합 크기에서 가장 좋은 성능을 보였다. kNN의 경우 10% 이하의 자질에서 가장 좋은 성능을 보였다. 단어 중의성 해소를 위한 자질선정을 적용할 때 작은 자질집합 크기와 큰 문맥 크기를 조합하거나, 반대로 큰 자질집합 크기와 작은 문맥 크기를 조합하면 성능을 극대화 할 수 있다.

한국어 원거리 음성의 지속시간 연구 (A Study on the Durational Characteristics of Korean Distant-Talking Speech)

  • 김선희
    • 대한음성학회지:말소리
    • /
    • 제54호
    • /
    • pp.1-14
    • /
    • 2005
  • This paper presents durational characteristics of Korean distant-talking speech using speech data, which consist of 500 distant-talking utterances and 500 normal utterances of 10 speakers (5 males and 5 females). Each file was segmented and labeled manually and the duration of each segment and each word was extracted. Using a statistical method, the durational change of distant-talking speech in comparison with normal speech was analyzed. The results show that the duration of words with distant-talking speech is increased in comparison with normal style, and that the average unvoiced consonantal duration is reduced while the average vocalic duration is increased. Female speakers show a stronger tendency towards lengthening the duration in distant-talking speech. Finally, this study also shows that the speakers of distant-talking speech could be classified according to their different duration rate.

  • PDF

통계적 단어 대조를 이용한 음식점 추천 챗봇 애플리케이션 구현 (Implementation of a Chatbot Application for Restaurant recommendation using Statistical Word Comparison Method)

  • 민동희;이우범
    • 융합신호처리학회논문지
    • /
    • 제20권1호
    • /
    • pp.31-36
    • /
    • 2019
  • 사용자로부터 입력되는 비정형 데이터를 대화 형태로 이해하여 사용자가 원하는 정보에 대한 맞춤 서비스를 제공하는 챗봇은 모바일 서비스의 중요한 분야로서 주목받고 있다. 그러나 사용자의 자연 언어 형태의 질의 대화를 완전하게 이해하여 서비스할 수 있는 방법은 아직 미흡한 실정이다. 따라서 본 논문에서는 사용자가 음식점 추천을 위하여 입력하는 대화 문장으로부터 지역, 음식분류, 음식점명 등의 의미 단어를 추출하고, 추출된 단어를 SNS의 음식점 추천 관련 해시태그를 기반으로 구축된 지식 데이터베이스의 내용과 대조하여 통계적으로 단어 유사성이 가장 큰 사용자 목적 정보를 제공한다. 본 논문에서 구현한 음식점 추천 챗봇 시스템의 성능 평가를 위해서 웹 기반의 모바일 환경을 구축하여 다양한 사용자 질의 정보에 대한 접근 편의성을 측정한 결과, 기존 유사 서비스와 비교하여 터치 횟수와 화면 전환 횟수에서 각각 37.2%와 73.3%의 감소함을 보였다.

한국어 롬바드 음성의 지속시간 연구 (A Study on the Durational Characteristics of Korean Lombard Speech)

  • 김선희
    • 대한음성학회:학술대회논문집
    • /
    • 대한음성학회 2005년도 춘계 학술대회 발표논문집
    • /
    • pp.21-24
    • /
    • 2005
  • This paper presents durational characteristics of Korean Lombard speech using data, which consist of 500 Lombard utterances and 500 normal utterances of 10 speakers (5 males and 5 females). Each file was segmented and labeled manually and the duration of each segment and each word was extracted. The durational change of Lombard effect in comparison with normal speech was analyzed using a statistical method. The results show that the duration of words with Lombard effect is increased in comparison with normal style, and that the average unvoiced consonantal duration is reduced while the average vocalic duration is increased. Female speakers show a stronger tendency towards lengthening the duration in Lombard speech, but without statistical significance. Finally, this study also shows that the speakers of Lombard speech could be classified according to their different duration rate.

  • PDF

이상 탐지를 위한 시스템콜 시퀀스 임베딩 접근 방식 비교 (Comparison of System Call Sequence Embedding Approaches for Anomaly Detection)

  • 이근섭;박경선;김강석
    • 융합정보논문지
    • /
    • 제12권2호
    • /
    • pp.47-53
    • /
    • 2022
  • 최근 지능화된 보안 패러다임의 변화에 따라, 다양한 정보보안 시스템에서 발생하는 각종 정보를 인공지능 기반 이상탐지에 적용하기 위한 연구가 증가하고 있다. 따라서 본 연구는 로그와 같은 시계열 데이터를 수치형 특성인 벡터로 변환하기 위하여 딥러닝 기반 Word2Vec 모델의 CBOW와 Skip-gram 추론 방식과 동시발생 빈도 기반 통계 방식을 사용하여 공개된 ADFA 시스템콜 데이터에 대하여, 벡터의 차원, 시퀀스 길이 및 윈도우 사이즈를 고려한 다양한 임베딩 벡터로의 변환에 대한 실험을 진행하였다. 또한 임베딩 모델로 생성된 벡터를 입력으로 하는 GRU 기반 이상 탐지 모델을 통해 탐지 성능뿐만 아니라 사용된 임베딩 방법들의 성능을 비교 평가하였다. 통계 모델에 비해 추론 기반 모델인 Skip-gram이 특정 윈도우 사이즈나 시퀀스 길이에 치우침 없이 좀 더 안정되게(stable) 성능을 유지하여, 시퀀스 데이터의 각 이벤트들을 임베딩 벡터로 만드는데 더 효과적임을 확인하였다.

한국과 미국에 있어 영화 수익관련 통계량과 확산 현상의 비교분석 (Comparative Analysis of Box-office Related Statistics and Diffusion in Korea and US Film Markets)

  • 김태구;홍정식
    • 경영과학
    • /
    • 제32권1호
    • /
    • pp.133-145
    • /
    • 2015
  • Motion picture industry in Korea has been growing constantly and aroused various kinds of research attention. Particularly, the introduction of official box-office database service brought quantitative studies. However, approaches based on diffusion models have been rarely found with domestic film markets. In addition to the fundamental statistical review on Korea and US film markets, we applied a diffusion model to daily box-office revenue. Unlike conventional preference of Gamma distribution on the film markets, estimation results proved that BMIC can also explain the trend of daily revenue successfully. The comparison with BMIC showed that there is a distinctive difference in diffusion patterns of Korea and US film markets. Generally, word-of-mouth effect appeared more significant in Korea.

중국 여성의 체형별 의복행동 및 의상디자인 선호도 연구 (A study on Clothing Behavior and Preference of clothing Design on the Comparison of Body types of Chinese Women)

  • 김효숙;임순;손희정
    • 대한가정학회지
    • /
    • 제39권11호
    • /
    • pp.15-26
    • /
    • 2001
  • China adopted a free market economy and is a member of WTO. It has now emerged as one of the most promising markets in the word for the near future. The purpose of this study was to investigate of Chinese women clothing behavior and preference of clothing design by body types and to suggest basic information for high quality clothes merchandising of exporting to China. The subjects in this study were 280 Chinese women, aged from 20 to 50 living in Beijing. The survey was taken from June to July, 1999. SAS(Statistical Analysis System) is used for frequency, percentage, average, standard deviation, $\chi$$^2$-test, factor analysis. The results of this study are as follows. Ewamination on the Chinese womens clothing behavior showed that they attach importance to economy for purchasing clothes and have affirmative self-confidence. The thin body type women prefer to fashionable clothes while the fat body type has more reasonable economic behavior for clothing. It is needed to different merchandising project by body type in China..

  • PDF

문법성과 어휘 응집성 기반의 영어 작문 평가 시스템 (An English Essay Scoring System Based on Grammaticality and Lexical Cohesion)

  • 김동성;김상철;채희락
    • 인지과학
    • /
    • 제19권3호
    • /
    • pp.223-255
    • /
    • 2008
  • 본 논문에서 우리는 문장의 문법성과 텍스트의 어휘 응집성 측정을 위주로 하는 영어 작문 자동평가시스템을 소개하려고 한다. 문법 검사를 위해서는 링크 파서를 사용하고 어휘 연쇄를 측정하기 위해서는 로제 시소러스를 사용한다. 자동 평가 시스템의 채점 신뢰도를 측정하기 위해서 자동 채점과 수동 채점의 결과를 통계적으로 비교한다. 카파 통계와 다국면 Rasch 모형에 따른 분석 결과 자동 채점은 수동 채점과 유사성이 크며 수동 채점과 비교해서 신뢰성에 특별한 문제가 없다는 결론을 내리게 된다. 본 연구의 가장 큰 의의는 다양한 종류의 기술과 도구를 바탕으로 신뢰할 만한 수준의 영작문 자동 평가 시스템을 개발했다는 것이다. 평가 대상이 문장 단위를 넘어 선 텍스트 단위이며, 단어나 문법 등의 형식적 측면만 검사하는 것이 아니라 내용적 측면도 평가한다.

  • PDF

A Method for Compound Noun Extraction to Improve Accuracy of Keyword Analysis of Social Big Data

  • Kim, Hyeon Gyu
    • 한국컴퓨터정보학회논문지
    • /
    • 제26권8호
    • /
    • pp.55-63
    • /
    • 2021
  • 소셜 빅데이터는 신조어나 고유명사를 포함하는 경우가 많으며, 이들을 처리하기 위해 단어별 출현 빈도수를 기반으로 한 통계적인 형태소 분석 방법이 많이 활용되고 있다. 그러나 이들 방법에서는 복합 명사를 제대로 인지하지 못해, 키워드 추출의 정확도가 떨어지는 문제점이 지적되고 있다. 본 논문에서는 소셜 빅데이터의 키워드 분석에 있어 복합 명사를 추출하기 위한 방법을 제안한다. 제안 방법은 형태소 분석 단계를 통해 얻어진 단어를 조합하여 복합 명사 후보군을 만들고, 주어진 리뷰에서 이들의 출현 빈도를 조사하여 얻어진 빈도수를 기반으로 복합 명사를 추출한다. 복합 명사 후보군을 구성하는 방법에 따라 두 가지 알고리즘을 제안하였으며, 각 알고리즘의 성능을 수식으로 표현하고 비교한다. 그리고 온라인에서 수집된 실제 데이터를 대상으로 실험을 통해 비교 결과를 검증하는 동시에, 제안 방법이 실시간 처리에도 적합함을 보여준다.