• 제목/요약/키워드: 한글문서

Search Result 625, Processing Time 0.024 seconds

Design and Implementation of Hangul Document Recognition System by Stroke Extraction (획 추출에 의한 한글 문서 인식 시스템의 설계 및 구현)

  • Lee, Kwan-Yong;Lee, Yill-Byung
    • Annual Conference on Human and Language Technology
    • /
    • 1990.11a
    • /
    • pp.200-207
    • /
    • 1990
  • 본 논문은 다양한 활자체 및 크기의 한글 문자 영상에서의 정보량 및 엔트로피의 분포에 관한 연구이다. 12 종류의 서로 다른 활자체 및 크기의 한글 문자 영상이 실험에 사용되었으며, 사용 빈도수가 높은 520 자의 한글 문자 영상에 대하여 정보량과 엔트로피를 측정하였다. 실험 결과의 분석을 통하여 정보량과 엔트로피의 측정치는 문자의 구조적 형태에 따라 변하지만 활자체에는 무관하며, 대부분의 정보량이 문자의 가장자리 부분에 위치함을 알 수 있었다.

  • PDF

Multi-font/multi-size Hangul Character Recognition with Hierarchical Neural Networks (계층적 신경망을 이용한 다중크기의 다중활자체 한글문자인식)

  • Gwon, Jae-Uk;Jo, Seong-Bae;Kim, Jin-Hyeong
    • Annual Conference on Human and Language Technology
    • /
    • 1990.11a
    • /
    • pp.183-190
    • /
    • 1990
  • 본 논문에서는 인쇄체 한글문자를 실용적으로 인식하기 위하여 고안된 계층적 신경망을 소개하고, 이를 다중활자체의 한글문자를 인식하는 문제에 적용하였다. 이 신경망은 입력된 문자영상을 6가지의 유형으로 분류한 후, 해당 유형을 처리하는 신경망에서 실제 문자를 인식하도록 구성되었다. 또한 각 신경망을 모든 입력영상의 모든 출력노드에 대해 고르게 학습시키기 위하여 Backpropagation 알고리즘을 개선한 Descending Epsilon 알고리즘을 도입하였다. 그 결과 사용빈도수가 높은 한글 520자에 대해 94.4 - 98.4%의 인식률을 얻음으로써 본 논문에서 제안한 시스템이 다양한 활자체로 이루어진 실제 문서인식시스템의 문자인식부에 효과적으로 사용될 수 있음을 제시하였다.

  • PDF

Constructing and Implementing SGML/XML Information Retrieval Systems with a Case Study : STEER-SGML/XML (SGML/XML 정보검색 시스템의 구성과 구현 방법론 사례연구 : STEER-SGML/XML)

  • Park, Young-C.;Kim, Mun-Seok;Kim, Nam-Il;Zhoo, Zong-Cheol
    • Annual Conference on Human and Language Technology
    • /
    • 1998.10c
    • /
    • pp.105-110
    • /
    • 1998
  • SGML/XML은 임의 형태 문서, 임의 응용에 대해 일반화 마크업을 정의하기 위한 방법을 기술하는 메타언어이다. 즉 문서의 작성시에 고려되는 문서의 논리적 정보를 표현 가능하다. 이러한 논리적 구분을 이용하여 정보사용자에게 좀 더 정확한 검색을 제공할 수 있다. SGML/XML을 이용하여 표현된 계층적 논리정보를 이용하여 다양한 문서 접근점을 제공할 수 있으며, 문서의 재사용 및 동적인 문서제시를 가능케 한다. 본 논문에서는 SGML/XML 정보검색의 장점과 이러한 시스템을 구현하기 위한 구현 단계 및 구성요소를 알아보고자 한다. 아울러 구현사례로 STEER-SGML/XML 검색 시스템을 알아본다.

  • PDF

Automatic Naming of Document Clusters by Using their Hierarchical Structure (계층구조를 이용한 문서 클러스터 제목의 자동생성)

  • Kim, Tae-Hyun;Myaeng, Sung-Hyon
    • Annual Conference on Human and Language Technology
    • /
    • 2001.10d
    • /
    • pp.163-170
    • /
    • 2001
  • 웹에서 정보를 찾고자 하는 사용자들을 돕기 위해서는 조직화된 방법으로 검색 결과들을 제시하는 것이 바람직하다. 이러한 목적을 위해, 문서 클러스터링 기법들이 제안되었다. 문서 클러스터링은 사용자들이 관심의 대상이 되는 문서들을 더욱 쉽게 배치할 수 있게 하고, 검색된 문서집합에 대한 개관을 손쉽게 얻을 수 있게 한다. 클러스터링 결과로 주어지는 각 클러스터의 주제를 사용자들이 빠르게 파악할 수 있게 하려면 클러스터 제목을 표현하는 문제가 중요시 된다. 본 연구에서는, 웹 디렉토리의 계층적 구조를 사용하여 자동으로 클러스터 제목을 생성하는 방법을 제안한다. 이 방법은 대상이 되는 클러스터에 있는 문서들의 내용과 부합되는 계층상의 노드를 계층구조 상에서 찾아내어, 계층구조의 루트로부터 그 노드에 이르는 경로명을 클러스터의 제목으로 사용자에게 제시하도록 한다. 본 연구에서 제안한 모델은 '야후' 디렉토리를 사용하여 실험되었다. 실험 결과, 실험대상 클러스터의 본래 제목과 정확하게 일치하는 제목을 찾을 수 있는 경우의 정확률이 57.5% 의미적으로 본래 제목에 부합되는 제목을 찾을 수 있는 경우의 정확률이 대략 90%에 이른다는 것을 알 수 있었다.

  • PDF

Plagiarism Detected Source Retrieval and Text Alignment (표절 원본 문서 추출 및 표절 위치 탐색 기법)

  • Lee, Hyun-Young;Jeon, Seung-Cheol;Kang, Yu-Jin;Kim, Seung-Hwan;Lee, Are-Mi;Kang, Seung-Shik
    • Annual Conference on Human and Language Technology
    • /
    • 2014.10a
    • /
    • pp.187-192
    • /
    • 2014
  • 인터넷과 스마트기기 발전으로 정보에 대한 접근이 쉬워짐에 따라 다른 문서에 대한 표절 행위가 쉽게 이루어지고 있습니다. 그리고 표절 검사를 수행하는데 시간적, 인적, 공간적 낭비가 이루어진다. 이러한 낭비와 표절에 대한 경각심을 일으키고자 본 논문에서는 표절 검사 속도 향상을 위한 표절 원본 문서 추출(source retrieval)과 추출된 문서의 단어를 이용하는 표절 위치 탐색(text alignment)기법을 이용하여 표절구간을 찾는 방법을 제안한다. 본 논문의 표절 원본 문서 추출 및 표절 위치 탐색 기법을 활용하면 표절 검사의 시간과 정확도가 향상될 것으로 기대한다.

  • PDF

Development of a System of Writing Tools for Korean Documents (한국어 문서 작성 지원 툴의 설계 및 구현)

  • Lee, Hong-Su;Hong, Soon-Jae;Yoon, Jee-Hee
    • Annual Conference on Human and Language Technology
    • /
    • 1992.10a
    • /
    • pp.339-345
    • /
    • 1992
  • 한국어 문서 작성 지원 툴 ${\ulcorner}$한림${\lrcorner}$은 기계 가독형의 한국어 문서 화일을 해석하여, 문서의 오류 검출을 포함한 문서 작성상의 수정 지침이 될 수 있는 자료를 사용자에게 제공하는 것을 목적으로 하는 시스템이다. 본 시스템에서는 기본적으로 문법 해석이나 사전을 이용하지 않고 알고리즘을 이용한 문자 분석만에 의하여 한국어 문서를 해석한다. 여기에서는 현재 개발중인 ${\ulcorner}$한림${\lrcorner}$의 개발 목적, 방침, 구현 방법 등에 대하여 논하고, 부분적으로 완성된 몇 개의 툴을 소개한다.

  • PDF

Extracting Web-Table Information Using Decision Tree and Rule Based Approach (기계학습과 규칙 기반 접근 방법을 결합한 의미 있는 표 구분과 헤드 영역 추출)

  • Jung, Sung-Won;Park, Dae-Won;Kwon, Hyuk-Chul
    • Annual Conference on Human and Language Technology
    • /
    • 2004.10d
    • /
    • pp.5-11
    • /
    • 2004
  • 일반적으로 HTML문서는 크게 내용과 구조로 이루어져 있다. HTML은 일반 문서와 달리 태그라는 것으로 문서에 추가 정보를 주며, 문서의 내용을 더욱 명확하게 한다. 따라서 태그를 이용하면 일반 문서보다 정보를 쉽게 구별하고 추출할 수 있다. 이러한 여러 가지 태그들 중에서 본 연구는 표를 중점적으로 연구한다. 표는 행과 열을 이용하여 어떤 사실을 조직하여 전달하는 것으로, 다른 구조적 특성들 보다 정보를 조직하는데 매우 유용하며, 글로 기술할 많은 분량을 간단히 줄이는 역할을 한다. 이와 같은 표의 특성에 주목하여 표에서 정보를 추출하는 분야를 기존 연구자들은 Web Table Mining 명명하였다. 본 연구는 기존 연구자들이 간과한 표의 구조적인 특성을 이용하여 전체 인터넷 문서에 적용할 수 있는 방법과 함께, 표에서 의미 있는 정보 추출을 위한 단계적인 모형을 제시한다.

  • PDF

The Design and Implementation of HTML Document Integrity Management System (HTML 문서의 무결성 유지 시스템의 설계 및 구현)

  • 조이기;이영운;황인문;양수영;김원중
    • Proceedings of the Korean Institute of Information and Commucation Sciences Conference
    • /
    • 2002.05a
    • /
    • pp.380-383
    • /
    • 2002
  • It Is difficult to manage broken link with dangling reference, inaccurate reference m the manual site that is consist of HTML documents of much quantity as KLDP(Korean Linux Documentation Project, http:/ /kldp.org) Web site. In this paper. we define relationship and constrain renditions that exist between Web site's HTML documents. And we design and implement HIMS(HTML Document Integrity Management System), which notify user that integrity violation happens or launch trigger operation to keep integrity between HTML documents in case of insert, delete, update.

  • PDF

Automatic Dictionary Construction of Indonesian Field-Associated Terms by Using Korean Associated Knowledge (한국어의 분야 연상 지식의 추출 방법에 관한 연구)

  • Lee, Sang-Gon
    • Annual Conference on Human and Language Technology
    • /
    • 2016.10a
    • /
    • pp.205-210
    • /
    • 2016
  • 인간은 문서전체를 읽지 않고 대표적인 단어를 보는 것만으로 정치나 스포츠 등의 분야를 정확히 인지할 수 있다. 문서 전체는 물론 부분 텍스트(단락)에 출현하는 소수의 단어 정보에서 문서의 분야를 정확히 결정하기 위한 분야연상어의 구축은 중요한 연구과제이다. 미리 분야체계를 정의하고, 각 분야에 해당하는 문서를 인터넷이나 서적을 통해 수집한다. 본 논문은 수집 문서의 분야를 정확히 지시하는 분야연상어를 수집하는 방법을 제안한다. 문서의 분야결정 시점을 고려하여 분야연상어의 수준을 정하였다. 인도네시아어의 분야연상어 사전을 자동으로 구축하기 위해 먼저 한국어로 구축한 분야 연상 지식을 추출하는 방법을 제안한다.

  • PDF

Debatable SNS Post Detection using 2-Phase Convolutional Neural Network (2-Phase CNN을 이용한 SNS 글의 논쟁 유발성 판별)

  • Heo, Sang-Min;Lee, Yeon-soo;Lee, Ho-Yeop
    • Annual Conference on Human and Language Technology
    • /
    • 2016.10a
    • /
    • pp.171-175
    • /
    • 2016
  • 본 연구는 SNS 문서의 논쟁 유발성을 자동으로 감지하기 위한 연구이다. 논쟁 유발성 분류는 글의 주제와 문체, 뉘앙스 등 추상화된 자질로서 인지되기 때문에 단순히 n-gram을 보는 기존의 어휘적 자질을 이용한 문서 분류 기법으로 해결하기가 어렵다. 본 연구에서는 문서 전체에서 전역적으로 나타난 추상화된 자질을 학습하기 위해 2-phase CNN 기반 논쟁 유발성 판별 모델을 제안한다. SNS에서 수집한 글을 바탕으로 실험을 진행한 결과, 제안하는 모델은 기존의 문서 분류에서 가장 많이 사용된 SVM에 비해 월등한 성능 향상을, 단순한 CNN에 비해 상당한 성능 향상을 보였다.

  • PDF