• 제목/요약/키워드: 단어길이

검색결과 147건 처리시간 0.023초

한국어 동사와 명사 관용구 인식 알고리즘 (A recognition algorithm of Korean verb and noun idiomatic phrases)

  • 이호석
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2009년도 제21회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.170-175
    • /
    • 2009
  • 본 논문은 한국어 관용구 인식 알고리즘에 대하여 논의한다. 다음(daum) 전자 사전에는 관용구의 의미를, "두 개 이상의 단어로 이루어져 있으면서, 그 단어들의 의미만으로는 전체 의미를 알 수 없는, 특수한 의미를 나타내는 어구" 라고 설명되어 있다. 한국어 관용구의 길이는 2글자 ~ 4글자인 경우가 많으며 그 이상인 경우도 있다. 대부분의 관용구는 일반 사전에 동사와 명사를 기준으로 분류되어 있으며, 품사 표시나 구절 표시 없이 어절의 문자열 형태로만 표현되어 나타난다. 본 논문에서는 전자 사전에 품사 표시나 구절 표시 없이 어절 문자열 형태로 저장되어 있는 한국어 관용구를 입력 문장에서 인식하는 관용구 인식 알고리즘에 대하여 논의한다. 그리고 연어 인식과 명사의 의미 속성 처리에 대하여서도 논의한다.

  • PDF

가변 크기 문맥과 거리가중치를 이용한 동형이의어 중의성 해소 (Word sense disambiguation using dynamic sized context and distance weighting)

  • 이현아
    • Journal of Advanced Marine Engineering and Technology
    • /
    • 제38권4호
    • /
    • pp.444-450
    • /
    • 2014
  • 의미 중의성 해소를 위한 대부분의 기존 연구에서는 문장의 특성에 상관없이 고정적인 크기의 문맥을 사용해 왔다. 본 논문에서는 중의성 해소에서 문장에 따라 가변적인 크기의 문맥을 사용하는 가변길이 윈도우와 단어간 거리를 사용한 의미분석 방법을 제안한다. 세종코퍼스의 형태의미분석 말뭉치로 학습하여 12단어 32,735문장에 대해 실험한 결과에서 제안된 방법이 용언에 대하여 92.2%의 평균 정확도를 보여 고정 크기의 문맥을 사용한 경우에 비해 향상된 결과를 보였다.

효율적인 하드웨어 공유를 위한 단어길이 최적화 알고리듬 (A bitwidth optimization algorithm for efficient hardware sharing)

  • 최정일;전홍신;이정주;김문수;황선영
    • 한국통신학회논문지
    • /
    • 제22권3호
    • /
    • pp.454-468
    • /
    • 1997
  • This paper presents a bitwidth optimization algorithm for efficient hardware sharing in digital signal processing system. The proposed algorithm determines the fixed-point representation for each signal through bitwidth optimization to generate the hardware requiring less area. To reduce the operator area, the algorithm partitions the abstract operations in the design description into several groups, such that the operations in the same group can share an operator. The partitioning result are fed to a high-level synthesis system to generate the pipelined fixed-point datapaths. The proposed algorithm has been implemented in SODAS-DSP an automatic synthesis system for fixed-point DSP hardware. Accepting the models of DSP algorithms in schematics, the system automatically generates the fixed-point datapath and controller satisfying the design constraints in area, speed, and SNR(Signal-to-Noise Ratio). Experimental results show that the efficiency of the proposed algorithm by generates the area-efficient DSP hardwares satisfying performance constraints.

  • PDF

영어 학습자의 중간 언어 단어 수준 강세 비교 (Comparison of Word Level Stress Features between Korean, English and the Interlanguage of Korean Learners of English)

  • 이윤현
    • 한국콘텐츠학회논문지
    • /
    • 제20권11호
    • /
    • pp.378-390
    • /
    • 2020
  • 영어 강세는 발화된 영어 단어를 이해하는 데 상당히 중요한 역할을 하며 잘못된 강세의 위치는 의사소통의 실패로 이어질 수 있다. 강세가 없는 것으로 알려진 한국어를 모국어로 둔 영어 학습자는 영어 운율체계를 습득하는 데 어려움을 겪을 것으로 예상된다. 본 연구는 한국어가 단어 수준에서 이러한 강세를 실현하는 것이 영어와 어떻게 다른지 그리고 한국인 영어 학습자의 중간언어가 이 두 언어와 어떻게 다른지 연구하였다. 다음 절로 이루어진 4개의 영어 외래어와 그들의 영어 원어 4개가 실험단어로 사용되었다. 10명의 영어 원어민이 영어 원어를 읽었으며 10명의 한국인 영어 학습자가 먼저 영어 외래어를 한국어로 그리고 나중에는 영어 원어를 영어로 읽었다. 120개의 발화 샘플을 분석한 결과 한국어에는 모든 강세 자질로 (즉, 조음 길이, 조음 크기, 조음의 높이) 실현되는 두드러진 음절이 없었다. 반면에 영어는 모든 강세 자질에 의해 일관되게 실현되는 상대적으로 두드러진 음절을 가지고 있었다. 흥미롭게도 영어 강세 실현에 있어 한국인 영어 학습자의 중간언어는 모국어보다도 영어와 비슷한 특징을 보여 주었다.

문서의 불균등 분포를 고려한 단어 불순도 기반 특징 선택 방법 (An Enhanced Feature Selection Method Based on the Impurity of Words Considering Unbalanced Distribution of Documents)

  • 강진범;양재영;최중민
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제34권9호
    • /
    • pp.804-816
    • /
    • 2007
  • 기계 학습 과정에서 수집된 많은 정보들 중에는 학습하고자 하는 개념과 관련이 없거나 중복된 정보를 가진 경우가 많다. 또한 자료 자체에 오류가 있기도 하다. 이와 같이 학습 모델 생성을 위해 수집된 정보를 신뢰할 수 없다면, 학습 과정에서도 정확한 지식 습득이 어렵다. 그래서 기계 학습은 학습 과정에서 정확한 지식 습득을 위해 특징 선택 방법을 사용한다. 특징 선택은 학습할 클래스와 관련이 없거나 중복된 정보를 학습 모델 생성 이전에 제거함으로써 학습 알고리즘의 성능을 향상시킨다. 기존의 특징선택 방법들은 적절한 특징을 선택하기 위하여 문서가 균등하게 분포되어 있다고 가정한다. 하지만, 실제로는 그렇지 않으며, 문서의 수 또는 문서의 길이가 모두 동일한 학습 예제를 준비하는 것도 매우 어렵다. 본 논문에서는 보다 효율적으로 특징을 선택하기 위해 클래스 별 단어의 불순도와 문서의 불균등 분포를 고려한 특징 선택 방법을 제안한다. 클래스를 대표할 수 있는 특징 후보들을 단어의 불순도 측정을 통해 얻고, 문서의 불균등 분포를 고려하여 특징을 선택한다. 실험을 통해 보다 좋은 성능을 보임을 입증한다.

절단검색을 지원하는 전자사전 구조 (An Electronic Dictionary Structure supporting Truncation Search)

  • 김철수
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제9권1호
    • /
    • pp.60-69
    • /
    • 2003
  • 역화일을 파일구조로 이용하는 정보 검색 시스템에서는 검색자가 검색할 분야의 완전 단어를 알고 있어야 검색이 가능하다. 그러나 검색자가 완전 단어가 아닌 단어의 부분 문자열을 알고 있는 경우가 많다. 이럴 경우 부분 문자열을 포함하는 색인어들을 검색할 수 있다면 관련 문서들을 검색할 수 있다. 또한 검색된 문헌 수가 너무 적을 경우 부분 문자열을 포함하는 단어를 색인어로 가지는 모든 문서들을 검색하기 위한 방법이 필요하다. 이런 요건들을 충족시키기 위해서는 사용자는 용어 절단 방법을 이용하여 질의어를 구성할 수 있어야 하고, 검색 시스템은 절단 검색을 지원할 수 있는 전자 사전이 필요하다. 본 논문에서는 절단검색을 효율적으로 지원할 수 있는 전자 사전 구조를 설계하고 구현한다. 이 전자 사전은 저장된 단어 수에 관계없이 주어진 한 개의 단어 검색 시간 및 역 문자열로 구성된 단어 검색 시간이 빠르고 일정하다. 절단검색을 효율적으로 지원하기 위하여 트라이 구조를 이용하였으며, 빠른 검색 시간을 지원하기 위해 배열을 이용한 방법을 사용하였다. 절단된 용어의 검색 과정에서 확장할 문자열의 길이를 최소화하여 검색 시간을 줄였다.

목차를 이용한 한국어 권말색인 표목의 선정 (The Use of Contents in Selecting the Headings of Korean Book Indexes)

  • 이태영
    • 한국정보관리학회:학술대회논문집
    • /
    • 한국정보관리학회 1996년도 제3회 학술대회 논문집
    • /
    • pp.49-52
    • /
    • 1996
  • 색인작성 모형을 구축하는데 필요한 기초적인 자료로서 색인표목 선정을 목차와 결부시켜 고찰하였다. 색인길이는 본문의 3%이고, 네 개 이하의 참조 수를 갖는 색인어는 95.8%이며, 목차항목이 색인에 출현한 도서는 100%이었다. 계층표목을 갖는 분석색인에 계층적 목차항목의 50%가 준용되었고, 목차의 고유어는 거의 색인어에 올랐다. 주절과 주어 등 문법상 주제적인 위치에 있는 단어와 구들이 다수 색인표목으로 선정되어 앞으로 목차항목 등과의 상호관련에 대한 연구가 진행되어야 할 것으로 사려된다.

  • PDF

시소러스를 이용한 문서 자동 요약 (Automatic Text Summarization Using Thesaurus)

  • 이창범;박혁로
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2001년도 봄 학술발표논문집 Vol.28 No.1 (B)
    • /
    • pp.352-354
    • /
    • 2001
  • 문서 자동요약은 입력된 문서에 대해 컴퓨터가 자동으로 요약을 생성하는 과정을 의미한다. 즉, 컴퓨터가 문서의 기본적인 내용을 유지하면서 문서의 복잡도 즉 문서의 길이를 줄이는 작업이다. 효율적인 정보 접근을 제공함과 동시에 정보 과적재를 해결하기 하기 위한 하나의 방법으로 문서 자동요약에 관한 연구가 활발히 진행되고 있다. 본 논문에서는 의미기반 정보검색용 시소러스(thesaurus)를 이용한 문서 자동요약을 제안한다. 제안한 방법에서는 단어간의 연관 관계 즉, 동의어, 유의어, 상위어, 하위어 관계를 문서 요약에 이용한다. 크게 연관 사슬 형성 단계, 중심 문장 추출 단계, 요약 생성 단계의 새단계로 나누어 요약을 생성한다. 수동 요약된 신문기사를 대상으로 평가한 결과 평균 66%가 일치하였다.

  • PDF

디지털 PID 제어기의 제한 요소 영향 분석(II):유한 단어 길이 문 (Analysis of Limitation Factor Effects on Digital PID Controller(II) : Finite Wordlength Issue)

  • 홍석민;김인중;이상정
    • 대한전기학회논문지
    • /
    • 제43권2호
    • /
    • pp.318-329
    • /
    • 1994
  • This paper deals with the finite wordlength effect on the performance of digital PID controllers. The finite wordlength, one of the major limitation factors in digital controllers, results on two kinds of quantization error : the signal quantization error and the coefficient quantization error. This paper derives the variance of the plant output due to the signal quantization error. Using stability margins as performance criterion, the statistical wordlength concept is adopted for coefficient wordlength selection. Finally, the experimental results exhibit satisfactory performance of the digital PID controller with statistical coefficient wordlength.

분절음적, 운율적 환경과 무성모음의 실현 (Segmental and prosodic environments and vowel devoicing in Korean)

  • 신지영;채은애
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2002년도 하계학술발표대회 논문집 제21권 1호
    • /
    • pp.309-312
    • /
    • 2002
  • 무성모음화 현상이 어떠한 분절음적, 운율적 환경에서 주로 실현되는가를 알아보기 위하여 선행자음의 분절음적 환경, 후행자음의 분절음적 환경, 해당 강세구의 음절수, 운율 구조상의 위치 등 모두 네 가지를 변수로 실험을 진행하였다. 모두 10명의 화자(남5, 여5)가 발화한 1140개의 자료에 나타난 행당 모음의 길이를 측정하는 방법으로 분석을 실시하였다. 그 결과 선행자음은 [+기식성]과 [+지속성]을 가진 환경이, 후행 자음은 [-지속정]과 [기식성]을 가진 환경이 무성모음화가 잘 일어나는 환경인 것으로 밝혀졌다. 음절수의 증가는 큰 영향을 주지 않는 것으로 보였고, 대체로 두 번째 강세구의 단어초에 위치하는 경우에 모음의 길이가 짧거나 무성모음화되는 경향이 관찰되었다.

  • PDF