• 제목/요약/키워드: 복합명사 분리

검색결과 15건 처리시간 0.021초

여과 및 분리 기법을 이용한 한국어 기준명사 추출 (Base-Noun Extraction with filtering and Segmentation in Korean)

  • 김재훈;김준홍;박호진
    • 한국인지과학회:학술대회논문집
    • /
    • 한국인지과학회 2000년도 한글 및 한국어 정보처리
    • /
    • pp.3-10
    • /
    • 2000
  • 웹의 등장으로 방대한 양의 문서를 다루는 정보검색, 정보추출, 정보요약 등의 분야에서 명사 추출은 대단히 중요한 역할을 담당하는 한 모듈이다. 본 논문에서는 대량의 문서에서 효과적으로 명사를 추출하기 위해 여과기법과 분리기법을 이용한 한국어 기준명사 추출 시스템을 기술한다. 기준명사는 명사들 중에서 기본이 되는 명사로서 복합명사는 제외된다. 본 논문의 기본적인 개념은 먼저 여과기법을 이용해서 명사를 포함하지 않은 어절을 미리 제거하고, 그리고 분리기법을 이용해서 명사가 포함된 어절에서 명사어구와 조사를 분리하고, 복합명사에 해당할 경우에는 각 명사를 분리하여 기준명사를 추출한다. ETRI 말뭉치를 대상으로 실험한 결과, 재헌율과 정확률 모두 약 89% 정도의 성능을 보였으며, 제안된 시스템을 한국어 정보요약 시스템에 적용해 보았을 때, 좋은 결과를 얻을 수 있었다.

  • PDF

여과 및 분리 기법을 이용한 한국어 기준명사 추출 (Base-Noun Extraction with Filtering and Segmentation in Korean)

  • 김재훈;김준홍;박호진
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2000년도 제12회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.3-10
    • /
    • 2000
  • 웹의 등장으로 방대한 양의 문서를 다루는 정보검색, 정보추출, 정보요약 등의 분야에서 명사 추출은 대단히 중요한 역할을 담당하는 한 모듈이다. 본 논문에서는 대량의 문서에서 효과적으로 명사를 추출하기 위해 여과기법과 분리기법을 이용한 한국어 기준명사 추출 시스템을 기술한다. 기준명사는 명사들 중에서 기본이 되는 명사로서 복합명사는 제외된다. 본 논문의 기본적인 개념은 먼저 여과기법을 이용해서 명사를 포함하지 않은 어절을 미리 제거하고, 그리고 분리기법을 이용해서 명사가 포함된 어절에서 명사어구와 조사를 분리하고, 복합명사에 해당할 경우에는 각 명사를 분리하여 기준명사를 추출한다. ETRI 말뭉치를 대상으로 실험한 결과 재현율과 정확률 모두 약 89% 정도의 성능을 보였으며, 제안된 시스템을 한국어 정보시스템에 적용해 보았을 때, 좋은 결과를 얻을 수 있었다.

  • PDF

음절수에 따른 한국어 복합 명사 분리 방안 (A Division Method of Korean Compound Noun by number of syllable)

  • 최재혁
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1996년도 제8회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.262-267
    • /
    • 1996
  • 한국어 맞춤법 검사기는 문서내에서 발생되는 비표준어 오류, 띄어쓰기/붙여쓰기 오류, 조사/어미 오류, 외래어 오류, 철자 오류 등에 대해서 이에 적합한 대치어를 제시해 준다. 일반적으로 한국어의 맞춤법 오류 중 가장 빈번하게 발생되는 것이 띄어쓰기 오류이며, 이 중에서도 복합 명사에 대한 띄어쓰기 오류가 가장 많이 발생한다. 본 논문에서는 복합 명사에 대한 띄어쓰기 교정 방안으로 복합명사의 음절수에 따라 1개의 결과만을 출력하도록 하는 복합 명사 분리 방안을 제시하며, 또한 복합 명사 분리 시의 사전 참조 횟수를 줄이는 방법을 제안한다.

  • PDF

사용빈도와 의미투명도가 복합명사의 분리처리에 미치는 효과 (Effects of word frequency and semantic transparency on decomposition processes of compound nouns)

  • 이태연
    • 인지과학
    • /
    • 제18권4호
    • /
    • pp.371-398
    • /
    • 2007
  • 이 연구는 의미점화과제와 반복점화과제를 사용하여 사용빈도와 의미투명성이 복합명사의 분리처리 양상에 어떤 영향을 미치는지를 알아보았다. 실험 1에서는 사용빈도에 따라 복합명사의 분리처리 양상이 달라지는지를 검토하였다. 의미점화효과가 복합명사 연상어 조건에서 자극제시시차나 사용빈도와 무관하게 관찰되었으며, 반복점화효과는 부분조건과 전체조건에서 모두 관찰되었지만 부분조건에서 더 큰 반복점화효과를 보였다. 이 결과는 복합명사가 하위 형태소로 분리되어 처리되는 경로와 복합명사 전체로 처리되는 경로가 함께 존재할 가능성을 보여준다. 실험 2에서는 의미투명도에 따라 복합명사의 분리처리 양상이 달라지는지를 검토하였다. 의미점화효과가 복합명사 연상어 조건에서 자극제시시차나 의미투명도에 무관하게 관찰되었으며, 반복점화과제에서도 실험 1b와 유사한 결과를 보였다. 실험 1과 2의 결과는 어휘수준에서 분리처리경로와 전체처리경로를 통해 활성화된 의미가 개념 수준에서 이루어지는 상호작용과정을 통해 복합명사의 의미를 결정함을 시사한다.

  • PDF

한국어 기준명사 추출 및 그 응용 (Korean Base-Noun Extraction and its Application)

  • 김재훈
    • 정보처리학회논문지B
    • /
    • 제15B권6호
    • /
    • pp.613-620
    • /
    • 2008
  • 정보검색, 문서요약 등의 분야에서 명사추출은 매우 중요하다. 본 논문은 대량의 문서로부터 기준명사를 효과적으로 추출하기 위한 한국어 기준명사 추출 시스템을 제안하고 이를 문서요약 시스템에 적용한다. 기준명사는 명사들 중에서 기본이 되는 명사이며 복합명사는 포함되지 않는다. 본 논문에서는 두 가지 기술 즉 여과기법과 분리기법을 사용한다. 먼저 여과기법을 이용해서 명사를 포함하지 않은 어절을 미리 제거하고, 그리고 분리기법을 이용해서 명사가 포함된 어절에서 명사와 조사를 분리하고, 복합명사에 해당할 경우에는 각 명사를 분리하여 기준명사를 추출한다. ETRI 말뭉치를 대상으로 실험한 결과, 재현율과 정확률 모두 약 89% 정도의 성능을 보였으며, 제안된 시스템을 한국어 문서요약 시스템에 적용해 보았을 때, 좋은 결과를 얻을 수 있었다.

복합명사의 의미적 구조분석에 관한 연구 (A study on the Semantic Structure Analysis of Korean Compound Nouns)

  • 남궁황;이태영
    • 한국정보관리학회:학술대회논문집
    • /
    • 한국정보관리학회 2001년도 제8회 학술대회 논문집
    • /
    • pp.177-180
    • /
    • 2001
  • 복합명사의 효율적인 분석은 정보검색 시스템의 성능 향상에 중요한 영향을 미친다. 한국어에서는 복합명사가 다양한 구문적 유형으로 표현된다. 표면적으로 동일하게 표현된 복합명사일지라도 의미적으로는 서로 다르게 나타내거나 여러 개의 단위명사로 분리될 수가 있다. 이러한 문제를 해결하기 위해서는 복합명사를 구성하는 단위명사간의 의미적 결합관계를 올바르게 파악하는 것이 무엇보다도 중요하다. 본 논문에서는 의미적 구문관점에서 복합명사의 표층구조와 심층구조간의 의미관계를 기반으로 복합명사 분석시 적용할 수 있는 의미규칙을 도출하는데 있다.

  • PDF

한국어의 형태소해석 (Morphological Analysis of the Korean Language)

  • 이수현;;이주근
    • 대한전자공학회논문지
    • /
    • 제26권4호
    • /
    • pp.53-61
    • /
    • 1989
  • 한국어의 구문 및 의미해석등에 필요한 정보를 도출하기 위한 입력분의 형태해석에 대하여 기술한다. 명사구에서 명사와 조사를 분리하고, 복합명사의 분리점을 선택하는 조건을 규정하며, 변형된 복합명사를 처리하는 규칙을 표시한다. 그리고 규칙동사에서 어간과 어미를 분리하고, 변칙용언과 음운축약 등을 효과적으로 처리하기 위한 논리표현 형식을 제안한다. 이 논리표현은 해석규칙과 속성값으로 구성한다. 명사사전의 중복을 배제하기 위하여 "명사형 하다" 동사의 분리 처리와 Q parameter 도입에 의한 "이다"의 처리방법을 보이고, 또한 부정문의 처리형식도 유도하여 복합술부의 형태소와 기본형식을 제시한다.

  • PDF

음절 단위 임베딩과 딥러닝 기법을 이용한 복합명사 분해 (Compound Noun Decomposition by using Syllable-based Embedding and Deep Learning)

  • 이현영;강승식
    • 스마트미디어저널
    • /
    • 제8권2호
    • /
    • pp.74-79
    • /
    • 2019
  • 기존의 복합명사 분해 알고리즘은 미등록어 단위명사들이 포함된 복합명사를 분해할 때 미등록어를 분리하기 어려운 문제가 발생한다. 이는 현실적으로 모든 고유명사, 신조어, 외래어 등의 모든 단위 명사를 사전에 등록하는 것은 불가능하다는 한계가 존재하기 때문이다. 이 문제를 해결하기 위하여 복합명사 분해 문제를 태그 열 부착(sequence labeling) 문제로 정의하고 음절 단위 임베딩과 딥러닝 기법을 이용하는 복합명사 분해 방법을 제안한다. 단위명사 사전을 구축하지 않고 미등록 단위명사를 인식하기 위하여 복합명사를 구성하는 각 음절들을 연속적인 벡터 공간에 표현하여 LSTM과 선형체인(linear-chain) CRF를 이용하는 방식으로 복합명사를 단위명사들로 분해한다.

복합명사 분리 색인 방법이 문서 클러스터링에 미치는 영향 분석 (An Analysis of the Hierarchical Agglomerative Clustering based on various Compound Noun Indexing Method)

  • 양명석;최성필
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2002년도 가을 학술발표논문집 Vol.29 No.2 (2)
    • /
    • pp.697-699
    • /
    • 2002
  • 본 논문에서는 복합명사에 대한 색인 방법을 다각적으로 적용하여 계층적 결함 문서 클러스터링 시스템의 결과를 분석하고자 한다. 우선 한글 색인 엔진과 HAC(Hierarchical Agglumerative Clustering) 엔진에 대해서 설명하고 한글 색인엔진에서 제공되는 세가지 복합명사 분석 모드에 대해서 설명한다. 또한 구현된 클러스터링 엔진의 특징과 속도 향상을 위한 기법 등을 설명한다. 실험에서는 다양한 요소를 가지고 클러스터링된 문서 집합에 대한 분석 결과를 보인다. 실험 결과에 대한 분석에서 복합명사에 대한 색인 방법이 문서 클러스터링의 결과에 직접적인 영향을 준다는 것을 보여준다.

  • PDF

의존관계에 근거한 키워드 추출방법 (Keyword Abstraction Method to be based in Dependence)

  • 정규철;이진관;이태헌;박기홍
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2001년도 추계학술발표논문집 (하)
    • /
    • pp.1221-1224
    • /
    • 2001
  • 논문의 키워드는 논문을 읽을지 여부를 알아보는 아주 중요한 요소로 존재이다. 그러나 키워드가 되는 단어가 원문 중에 존재하지 않고, 키워드의 구성 단어로 분리하여 존재하는 경우에는 대처할 수 없다. 본 논문에서는 문서를 읽기 위한 판단의 재료가 되는 키워드의 추출을 목적으로 하고, 특히 복합명사 생성 규칙을 이용하여 키워드의 구성 단어로 분리되어 존재하는 키워드를 추출하는 방법을 제안한다.

  • PDF