• 제목/요약/키워드: Character Extraction

검색결과 303건 처리시간 0.022초

The Centering of the Invariant Feature for the Unfocused Input Character using a Spherical Domain System

  • Seo, Choon-Weon
    • 조명전기설비학회논문지
    • /
    • 제29권9호
    • /
    • pp.14-22
    • /
    • 2015
  • TIn this paper, a centering method for an unfocused input character using the spherical domain system and the centering character to use the shift invariant feature for the recognition system is proposed. A system for recognition is implemented using the centroid method with coordinate average values, and the results of an above 78.14% average differential ratio for the character features were obtained. It is possible to extract the shift invariant feature using spherical transformation similar to the human eyeball. The proposed method, which is feature extraction using spherical coordinate transform and transformed extracted data, makes it possible to move the character to the center position of the input plane. Both digital and optical technologies are mixed using a spherical coordinate similar to the 3 dimensional human eyeball for the 2 dimensional plane format. In this paper, a centering character feature using the spherical domain is proposed for character recognition, and possibilities for the recognized possible character shape as well as calculating the differential ratio of the centered character using a centroid method are suggested.

고속 문자 인식을 위한 특정 추출용 칩의 구현 (Implementation of a Feature Extraction Chip for High Speed OCR)

  • 김형구;강선미;김덕진
    • 전자공학회논문지B
    • /
    • 제31B권6호
    • /
    • pp.104-110
    • /
    • 1994
  • We proposed a high speed feature extraction algorithm and developed a feature vector extraction chip for high speed character recognition. It is hard to implement a high speed OCR by software alone with statistical method . Thus, the whole recognition process is divided into functional steps, then pipeline processed so that high speed processing is possible with temporal parallelism of the steps. In this paper we discuss the feature extraction step of the functional steps. To extract feature vector, a character image is normalized to 40$\times$40 pixels. Then, it is divided into 5$\times$5 subregions and 4x4 subregions to construct 41 overlapped subregions(10x10 pixels). It requires to execute more than 500 commands to extract a feature vector of a subregion by software. The proposed algorithm, however, requires only 10 cycles since it can extract a feature vector of a columm of subregion in one cycle with array structure. Thus, it is possible to process 12.000 characters per second with the proposed algorithm. The chip is implemented using EPLD and the effectiveness is proved by developing an OCR using it.

  • PDF

문자-에지 맵의 패턴 히스토그램을 이용한 자연이미지에서의 텍스트 영역 추출 (Text Region Extraction using Pattern Histogram of Character-Edge Map in Natural Images)

  • 박종천;황동국;이우람;권교현;전병민
    • 한국산학기술학회:학술대회논문집
    • /
    • 한국산학기술학회 2006년도 추계학술발표논문집
    • /
    • pp.220-224
    • /
    • 2006
  • 자연이미지에 포함된 텍스트는 많은 중요한 정보를 포함하고 있다. 그러므로 자연이미지에서 텍스트를 추출할 수 있다면 다양한 분야에서 활용될 수 있다. 본 논문에서는 문자-에지 맵 패턴 히스토그램 분석함으로서 텍스트 영역을 추출하는 방법을 제안한다. 캐니-에지 검출기로 에지를 추출하여 16가지 에지 맵을 생성하고, 에지 맵을 조합하여 문자 특징을 갖는 8가지 문자-에지 맵을 생성한다. 8가지 문자-에지 맵과 16가지 에지 맵을 이용하여 텍스트 후보 영역을 추출하고, 문자-에지 맵의 패턴 히스토그램 및 텍스트 영역의 구조적 특징을 이용하여 텍스트 후보 영역에 대한 검증을 수행하였다. 제안한 방법은 다양한 종류의 자연이미지를 대상으로 실험하였고, 복잡한 배경, 다양한 글꼴, 다양한 텍스트 컬러로 구성된 자연이미지에서 텍스트 영역을 효과적으로 추출하였다.

  • PDF

색상 단순화와 윤곽선 패턴 분석을 통한 이미지에서의 글자추출 (Text extraction in images using simplify color and edges pattern analysis)

  • 양재호;박영수;이상훈
    • 한국융합학회논문지
    • /
    • 제8권8호
    • /
    • pp.33-40
    • /
    • 2017
  • 본 논문은 이미지에서 효과적인 문자검출을 위해 색상단순화 및 윤곽선에서의 패턴 분석을 통한 문자 검출방법을 제안한다. 윤곽선 기반방법을 사용하는 문자검출 알고리즘은 단순한 배경의 이미지에서는 우수한 성능을 보이지만, 복잡한 배경의 이미지에서는 성능이 떨어지는 단점이 있다. 따라서 제안하는 방법은 복잡한 배경에서의 비문자영역을 최소화하기 위해 이미지 단순화 및 패턴분석을 통한 문자 검출 알고리즘을 제안한다. 먼저 이미지에서의 문자영역 부분을 검출하기 위하여 전처리 과정으로 K-means 군집화를 사용하여 이미지의 색상을 단순화하고, 색상 단순화 과정에서의 물체의 경계의 흐릿해짐을 개선하기 위해 고주파통과필터를 통해 물체의 경계를 강화한다. 그 후 모폴로지 기법의 팽창과 침식의 차이를 이용하여 물체의 윤곽선을 검출하고, 획득한 영역의 윤곽선 부분의 정보(높이, 너비 면적)를 구한 후 패턴분석을 통해 조건을 줌으로써 문자 후보영역을 판별하여 문자가 아닌 불필요한 영역(그림, 배경)을 제거한다. 최종 결과로 라벨링을 통해 불필요한 영역이 제거된 결과를 보여준다.

실시간 처리를 위한 컨테이너 ISO코드 인식시스템의 구현 (Implementation of the Container ISO Code Recognition System for Real-Time Processing)

  • 최태완
    • 한국정보통신학회논문지
    • /
    • 제10권8호
    • /
    • pp.1478-1489
    • /
    • 2006
  • 컨테이너 ISO코드 인식시스템은 ISO코드 검출 및 영상 획득, ISO코드 영역 추출, 개별 문자 추출, 문자인식 및 데이터베이스의 5가지 핵심부분으로 구성된다. 이 중에서도 ISO코드 추출의 정확성은 전체 시스템 인식률에 지대한 영향을 줄 수 있는 부분이며, 다양한 컨테이너 종류 및 주위 환경 변화에서도 정확한 추출을 요구한다. 본 논문에서는 획득된 영상을 주위 환경 변화에도 적응 가능한 이 진화 방법을 사용하여 ISO코드 템플릿의 영역을 이 진화하고 ISO코드의 분포를 가지는 후보 영역을 추출한다. 추출된 후보 영역 중에서 ISO코드 문자 분포의 특성을 이용한 검증과정을 통해 최종 영역을 추출하여 ISO코드를 인식하는 시스템을 설계 및 구현하였다. 구현된 시스템을 실시간으로 컨테이너에서 획득한 영상에 적용한 결과 다양한 컨테이너 종류 및 주위 환경변화에서도 ISO코드 영역이 정확히 추출됨을 확인하였다.

한국어 소설에서 유정명사용 조사 기반의 인물 추출 기법 (A Character Identification Method using Postpositions for Animate Nouns in Korean Novels)

  • 박태근;김승훈
    • 한국IT서비스학회지
    • /
    • 제15권3호
    • /
    • pp.115-125
    • /
    • 2016
  • Novels includes various character names, depending on the genre and the spatio-temporal background of the novels and the nationality of characters. Besides, characters and their names in a novel are created by the author's pen and imagination. As a result, any proper noun dictionary cannot include all kind of character names which have been created or will be created by authors. In addition, since Korean does not have capitalization feature, character names in Korean are harder to detect than those in English. Fortunately, however, Korean has postpositions, such as "-ege" and "hante", used by a sentient being or an animate object (noun). We call such postpositions as animate postpositions in this paper. In a previous study, the authors manually selected character names by referencing both Wikipedia and well-known people dictionaries after utilizing Korean morpheme analyzer, a proper noun dictionary, postpositions (e.g., "-ga", "-eun", "-neun", "-eui", and "-ege"), and titles (e.g., "buin"), in order to extract social networks from three novels translated into or written in Korean. But, the precision, recall, and F-measure rates of character identification are not presented in the study. In this paper, we evaluate the quantitative contribution of animate postpositions to character identification from novels, in terms of precision, recall, and F-measure. The results show that utilizing animate postpositions is a valuable and powerful tool in character identification without a proper noun dictionary from novels translated into or written in Korean.

자연영상에서 문자의 형태 분석을 이용한 문자영역 추출에 관한 연구 (A Study on Extraction of text region using shape analysis of text in natural scene image)

  • 양재호;한현호;김기봉;이상훈
    • 한국융합학회논문지
    • /
    • 제9권11호
    • /
    • pp.61-68
    • /
    • 2018
  • 본 논문에서는 일상에서 획득할 수 있는 자연 영상에서 문자를 검출하기 위해 영상 개선 및 문자의 형태를 분석하여 문자를 검출하는 방법을 제안한다. 제안하는 방법은 자연 영상에서 문자로 인식될 영역의 검출률을 향상시키기 위해 객체부분의 경계를 언샤프 마스크를 사용하여 강조하였다. 향상된 객체의 경계 부분을 이용하여 영상의 문자 후보영역을 MSER(Maximally Stable Extermal Regions)을 이용하여 검출하였다. 검출된 문자 후보영역에서 실제 문자로 판단될 영역을 검출하기 위해 각 영역들의 형태를 분석하여 글자의 특성을 갖는 영역외의 비 문자영역을 제거하여 실제 문자영역 검출률을 높였다. 본 논문의 정량적 평가를 위해 문자 영역의 검출률과 정확도를 이용하여 기존의 방법들과 비교하였다. 실험결과 기존의 문자 검출 방법보다 제안하는 방법이 비교적 높은 문자영역의 검출률 및 정확도를 보였다.

A Study on the Fractal Attractor Creation and Analysis of the Printed Korean Characters

  • Shon, Young-Woo
    • Journal of information and communication convergence engineering
    • /
    • 제1권1호
    • /
    • pp.53-57
    • /
    • 2003
  • Chaos theory is a study researching the irregular, unpredictable behavior of deterministic and non-linear dynamical system. The interpretation using Chaos makes us evaluate characteristic existing in status space of system by tine series, so that the extraction of Chaos characteristic understanding and those characteristics enables us to do high precision interpretation. Therefore, This paper propose the new method which is adopted in extracting character features and recognizing characters using the Chaos Theory. Firstly, it gets features of mesh feature, projection feature and cross distance feature from input character images. And their feature is converted into time series data. Then using the modified Henon system suggested in this paper, it gets last features of character image after calculating Box-counting dimension, Natural Measure, information bit and information dimension which are meant fractal dimension. Finally, character recognition is performed by statistically finding out the each information bit showing the minimum difference against the normalized pattern database. An experimental result shows 99% character classification rates for 2,350 Korean characters (Hangul) using proposed method in this paper.

한국어 번역 소설에서 인물명 명사구의 동일인물 공통참조 클러스터링 방법 (A Method for Clustering Noun Phrases into Coreferents for the Same Person in Novels Translated into Korean)

  • 박태근;김승훈
    • 한국멀티미디어학회논문지
    • /
    • 제20권3호
    • /
    • pp.533-542
    • /
    • 2017
  • Novels include various character names, depending on the genre and the spatio-temporal background of the novels and the nationality of characters. Besides, characters and their names in a novel are created by the author's pen and imagination. As a result, any proper noun dictionary cannot include all kinds of character names. In addition, the novels translated into Korean have character names consisting of two or more nouns (such as "Harry Potter"). In this paper, we propose a method to extract noun phrases for character names and to cluster the noun phrases into coreferents for the same character name. In the extraction of noun phrases, we utilize KKMA morpheme analyzer and CPFoAN character identification tool. In clustering the noun phrases into coreferents, we construct a directed graph with the character names extracted by CPFoAN and the extracted noun phrases, and then we create name sets for characters by traversing connected subgraphs in the directed graph. With four novels translated into Korean, we conduct a survey to evaluate the proposed method. The results show that the proposed method will be useful for speaker identification as well as for constructing the social network of characters.

Character Classification with Triangular Distribution

  • Yoo, Suk Won
    • International Journal of Advanced Culture Technology
    • /
    • 제7권2호
    • /
    • pp.209-217
    • /
    • 2019
  • Due to the development of artificial intelligence and image recognition technology that play important roles in the field of 4th industry, office automation systems and unmanned automation systems are rapidly spreading in human society. The proposed algorithm first finds the variances of the differences between the tile values constituting the learning characters and the experimental character and then recognizes the experimental character according to the distribution of the three learning characters with the smallest variances. In more detail, for 100 learning data characters and 10 experimental data characters, each character is defined as the number of black pixels belonging to 15 tile areas. For each character constituting the experimental data, the variance of the differences of the tile values of 100 learning data characters is obtained and then arranged in the ascending order. After that, three learning data characters with the minimum variance values are selected, and the final recognition result for the given experimental character is selected according to the distribution of these character types. Moreover, we compare the recognition result with the result made by a neural network of basic structure. It is confirmed that satisfactory recognition results are obtained through the processes that subdivide the learning characters and experiment characters into tile sizes and then select the recognition result using variances.