• Title/Summary/Keyword: 복합어(複合語) 분리(分離)

Search Result 21, Processing Time 0.023 seconds

A Division Method of Korean Compound Noun by number of syllable (음절수에 따른 한국어 복합 명사 분리 방안)

  • Choi, Jae-Hyuk
    • Annual Conference on Human and Language Technology
    • /
    • 1996.10a
    • /
    • pp.262-267
    • /
    • 1996
  • 한국어 맞춤법 검사기는 문서내에서 발생되는 비표준어 오류, 띄어쓰기/붙여쓰기 오류, 조사/어미 오류, 외래어 오류, 철자 오류 등에 대해서 이에 적합한 대치어를 제시해 준다. 일반적으로 한국어의 맞춤법 오류 중 가장 빈번하게 발생되는 것이 띄어쓰기 오류이며, 이 중에서도 복합 명사에 대한 띄어쓰기 오류가 가장 많이 발생한다. 본 논문에서는 복합 명사에 대한 띄어쓰기 교정 방안으로 복합명사의 음절수에 따라 1개의 결과만을 출력하도록 하는 복합 명사 분리 방안을 제시하며, 또한 복합 명사 분리 시의 사전 참조 횟수를 줄이는 방법을 제안한다.

  • PDF

A Study on Automatic Indexing of Korean Texts based on Statistical Criteria (통계적기법에 의한 한글자동색인의 연구)

  • Woo, Dong-Chin
    • Journal of the Korean Society for information Management
    • /
    • v.4 no.1
    • /
    • pp.47-86
    • /
    • 1987
  • The purpose of this study is to present an effective automatic indexing method of Korean texts based on statistical criteria. Titles and abstracts of the 299 documents randomly selected from ETRI's DOCUMENT data base are used as the experimental data in this study the experimental data is divided into 4 word groups and these 4 word groups are respectively analyzed and evaluated by applying 3 automatic indexing methods including Transition Phenomena of Word Occurrence, Inverse Document Frequency Weighting Technique, and Term Discrimination Weighting Technique.

  • PDF

Effects of word frequency and semantic transparency on decomposition processes of compound nouns (사용빈도와 의미투명도가 복합명사의 분리처리에 미치는 효과)

  • Lee, Tae-Yeon
    • Korean Journal of Cognitive Science
    • /
    • v.18 no.4
    • /
    • pp.371-398
    • /
    • 2007
  • This study examined effects of word frequency and semantic transparency on decomposition processes of compound nouns by semantic priming task and repetition priming task. In Experiment 1, it was investigated that decomposition process depended on word frequency of compound noun. Semantic priming effects were found In the compound noun's associate rendition consistently, and repetition priming effects were found in the whole rendition as well as in the part condition irrespective of word frequency and SOA. These results implied that compound noun was processed through decomposition process path and direct access path. In Experiment 2, Effects of semantic transparency on decomposition processes of compound nouns were examined. Semantic priming effects were found when compound nouns' associates were presented as primes irrespective of semantic transparency and SOA, and results were the same as experiment 1b in repetition priming task. Results of experiment 1 and 2 implies that compound nouns are interpreted by interactive activation processes of attributes activated by decomposition path and direct access path.

  • PDF

Automatic Keyword Extraction System for Korean Documents Information Retrieval (국내(國內) 문헌정보(文獻情報) 검색(檢索)을 위한 키워드 자동추출(自動抽出) 시스템 개발(開發))

  • Yae, Yong-Hee
    • Journal of Information Management
    • /
    • v.23 no.1
    • /
    • pp.39-62
    • /
    • 1992
  • In this paper about 60 auxiliary words and 320 stopwords are selected from analysis of sample data, four types of stop word are classified left, right and - auxiliary word truncation & normal. And a keyword extraction system is suggested which undertakes efficient truncation of auxiliary word from words, conversion of Chinese word to Korean and exclusion of stopword. The selected keyeords in this system show 92.2% of accordance ratio compared with manually selected keywords by expert. And then compound words consist of $4{\sim}6$ character generate twice of additional new words and 58.8% words of those are useful as keyword.

  • PDF

Multi-level Morphology and Morphological Analysis Model for Korean (다층 형태론과 한국어 형태소 분석 모델)

  • Kang, Seung-Shik
    • Annual Conference on Human and Language Technology
    • /
    • 1994.11a
    • /
    • pp.140-145
    • /
    • 1994
  • 형태소 분석은 단위 형태소를 분리한 후에 변형이 일어난 형태소의 원형을 복원하고, 분리된 단위 형태소들로부터 단어 형성 규칙에 맞는 연속된 형태소들을 구하는 과정이다. 이러한 일련의 분석 과정은 독립적인 특성이 강하면서 각 모듈이 서로 밀접하게 연관되어 있으므로 Two-level 모델에서는 형태론적 변형뿐만 아니라 형태소 분리 문제를 통합 규칙으로 처리하고 있다. 그러나 한국어에 Two-level 모델을 적응해 보면 형태소 분리와 형태론적 변형이 복합되어 있어서 교착어의 특성과 관계되는 단어 유형을 분석할 때 비효율적인 요소가 발견된다. 따라서 본 논문에서는 교착어인 한국어의 형태소 분석시에 발생하는 문제점들을 해결하는데 적합한 방법론으로 다층 형태론(multi-level morphology)과 다단계 모델(multi-level model)을 제안한다.

  • PDF

Recycling of Separate Glass Fiber from Waste Printed Circuit Boards Using Attrition Mill and DMF (어트리션 밀과 DMF 용매를 이용한 폐 인쇄회로기판에서 분리된 재생 유리섬유의 재활용)

  • Kim, Jong-Seok;Lee, Jae-Cheon;Jeong, Jin-Ki
    • Korean Chemical Engineering Research
    • /
    • v.50 no.5
    • /
    • pp.894-899
    • /
    • 2012
  • In recent years, recycling process has come to be necessary for separating metals, glass fibers and polymer from WPCBs (waste printed circuit boards) due to an increasing amount of electronic device waste. In this study, dimethylformamide (DMF) and attrition mill reactor were used to separate the component such as metals, glass fiber and epoxy resin from WPCBs. Separation of glass fiber from WPCBs was carried out under stirring rates 300~600 revolution per minute (rpm) for 1~2 h as the various agitator. The recycled glass fibers (RGF) were analyzed by thermogravimetric analyzer (TGA) for degree of separation of epoxy resin in the WPCBs. The degree of separation of epoxy resin of WPCBs increased in attrition mill agitator as a mechanochemical process for recycling WPCBs. The RGF separated in the WPCBs was applied as a reinforcement in the RGF/unsaturated polyester composites to reuse as a reinforcement.

DaHae: Japanese Morphological Analyzer for Japanese to Korean Machine Translation (DaHae: 일한 기계번역을 위한 일본어 형태소 분석기)

  • Yuh, Sang-Hwa;Jung, Han-Min;Chang, Won;Kim, Tae-Wan;Hwang, Do-Sam;Park, Dong-In
    • Annual Conference on Human and Language Technology
    • /
    • 1995.10a
    • /
    • pp.195-207
    • /
    • 1995
  • 일본어는 한자, 히라가나, 가다가나 등 다양한 종류의 문자를 사용하며 이들의 혼용 비율이 매우 높아 띄어쓰기를 하지 않아도 문서의 가독성을 유지한다. ICOT 사전, EDR 사전, ATLAS I/JK사전 등 기존의 전자 사전에서 복합 자종의 표제어가 차지하는 비율(한자+히라가나의 표제어 제외)은 평균 8.8%로 그 수가 매우 작다. 따라서, 문장 내에서 자종의 변화는 단어를 구분하는 하나의 delimiter로 이용될 수 있다. 본 시스템에서는 형태소 분석의 전단계로 전처리기를 두어 자종정보(character type information)에 의한 fragment 분리 및 예외 단어, 정형표현 처리를 수행하며 각 fragment 의 형태소 분석 방법을 제시한다. 형태소 분석기는 전처리기의 처리 결과를 입력받아 각각의 fragment를 전처리기가 제시한 분석 방법에 따라 분석하여 입력 문장의 가능한 모든 분석을 추출한다. 이 방법은 불필요한 사전 탐색과 접속 체크 회수를 줄여 분석 성능을 향상시킨다.

  • PDF

Compound Noun Decomposition by using Syllable-based Embedding and Deep Learning (음절 단위 임베딩과 딥러닝 기법을 이용한 복합명사 분해)

  • Lee, Hyun Young;Kang, Seung Shik
    • Smart Media Journal
    • /
    • v.8 no.2
    • /
    • pp.74-79
    • /
    • 2019
  • Traditional compound noun decomposition algorithms often face challenges of decomposing compound nouns into separated nouns when unregistered unit noun is included. It is very difficult for those traditional approach to handle such issues because it is impossible to register all existing unit nouns into the dictionary such as proper nouns, coined words, and foreign words in advance. In this paper, in order to solve this problem, compound noun decomposition problem is defined as tag sequence labeling problem and compound noun decomposition method to use syllable unit embedding and deep learning technique is proposed. To recognize unregistered unit nouns without constructing unit noun dictionary, compound nouns are decomposed into unit nouns by using LSTM and linear-chain CRF expressing each syllable that constitutes a compound noun in the continuous vector space.

Content based Image retrieval using Object Shape Token Clustering (객체 외형의 토큰 군집화를 통한 내용 기반 영상 검색)

  • Jeong Seok-hyun;KIM Gae-Young
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2005.07b
    • /
    • pp.880-882
    • /
    • 2005
  • 내용기반 영상 검색 시스템은 데이터베이스에 저장된 정지영상의 색이나, 질감, 형태 등의 특징을 이용한다. 본 연구는 실험 영상 집합에서 주요 객체를 추출하여, 객체들의 외형으로부터 분리된 토큰들을 군집화 한 후, 그 군집단위를 색인어로 사용하여 검색하는 방법이다. 기존의 내용기반 영상 검색 시스템에서 모양 정보는 그 표현과 색인 정합 등의 문제로 처리 방법이 명확하지 않았고, 회전, 크기 변화, 폐색 등에 민감했다. 따라서 기존 방법의 문제점을 해결하기 위해서 토큰을 이용한 색인을 이용하여 지역 정보와, 이들 지역 정보들의 관계에 의한 전역 정보를 복합적으로 이용한 방법을 제안한다.

  • PDF

A Study on the Evaluation of Newspaper Thesaurus (신문 시소러스의 평가에 관한 연구 : 신문기사 종합시소러스를 중심으로)

  • 이인애
    • Journal of the Korean Society for information Management
    • /
    • v.12 no.1
    • /
    • pp.99-113
    • /
    • 1995
  • This study evaluates representability and comprehensivity of the Theasurus in theeconomics and industry fields of the "General Thesaurus of Newspaper Articles." The methodsused in the study were, first, indexing of the pages covering economics and industry articlesusing the Thesaurus and second, comparing the Thesaurus terms with the words collectedfrom the newspapers articles and glossaries. The study clarifies the following problems whichmight occur in the construction and use of newspaper thesaurus: specificity of the subjectconcepts, separation of component concept, preference relationship between descriptors andentry terms, the methods of recording of proper nouns and allocation of terms among thesubject areas concern.he subject areas concern.

  • PDF