• 제목/요약/키워드: 문서영상

검색결과 381건 처리시간 0.026초

문서의 효율적 영역 분할과 JBIG2 CODEC의 구현 (Implementation of JBIG2 CODEC with Effective Document Segmentation)

  • 백옥규;김현민;고형화
    • 한국통신학회논문지
    • /
    • 제27권6A호
    • /
    • pp.575-583
    • /
    • 2002
  • JBIG2는 2진 영상과 문서 압축을 위한 국제 표준이다. JBIG2 표준은 2진 영상과 문서를 고압축으로 부호화하기 위해 영역 특징에 따라 세 가지 부호화 모드를 제공한다. MMR이나 산술 부호화를 이용하여 비트맵(bitmap)의 부호화를 위한 제너릭 영역(Generic region) 부호화를 한다. 그리고, 텍스트 영역의 부호화를 위해 패턴 매칭(Pattern Matching) 부호화를 하고, 하프톤 영역(Halftone region) 부호화를 위해 하프톤 패턴 부호화(Halftone Pattern Coding)를 한다. 본 논문에서는 JBIG2 부호화를 위해 문서를 라인아트, 하프톤, 텍스트 영역으로 분할한 후 각 영역에 제너릭 영역 부호화, 심벌 매칭 부호화, 하프톤 패턴 부호화를 하는 JBIG2 CODEC을 구현하였다. 문서의 효율적 영역 분할을 위해 윤곽선 추출법을 이용한 영역분할 방법과 웨이브릿 계수분표를 이용한 영역 분할 방법을 함께 적용하여 facsimile 테스트 영상(IEEE-167a)의 경우 2% 정도의 압축률 개선과 주관적 화질의 향상을 얻었다. 또한 임의 모양 하프톤 영역의 부호화를 제안하여 기존 영역 분할 방법에서 인지할 수 없는 임의 모양 하프톤 영역 주변 텍스트의 주관적 화질을 개선하였다.

칼라 문서에서 문자 영역 추출믹 문자분리 (The Character Area Extraction and the Character Segmentation on the Color Document)

  • 김의정
    • 한국지능시스템학회논문지
    • /
    • 제9권4호
    • /
    • pp.444-450
    • /
    • 1999
  • 본 논문에서는 칼라로 입력된 문서 영상에서 문자 영역추출을 위하여 k-means을 이용한 클러스트링 알고리즘을 제안하였다. 칼라 영상의 클러스트링을 위해서 HIS 좌표계에 적합한 거리함수를 제안하였다. 이를 인식하기 위한 전처리 단계인 문자분리(segmentation)방법은 연결 화소를 이용한 개별문자 추출 알고리즘을 제안하였다. 본 알고리즘 에서는 문자분리방벙에서 접촉문자 (touching character)또는 겹친 문자(overlapped character)등과 같이 분리가 곤란한 문자를 개별문자로 분리하는 방법이다. 기존의 문자 분리방법에서는 투영(projection)dop 의한 방법과 외곽선(edge)추적에 의한 방법등을 사용하여 왔으나 제안된 방법은 문자열 추출후 한번의 투영으로 연결화소를 이용하여 개별문자를 추출한다. 문자 영역과 비 문자 영역을 구분하여 개발문자 추출을 한 결과 단순한 이진 영상이 아닌 칼라 영상에서의 문서 처리가 큰 의의가 있고 기존의 문서 처리기 보다 향상된 알고리즘인 것을 확인하였다.

  • PDF

텍스트 영역에 대한 단어 단위 분할 시스템 (A System for the Decomposition of Text Block into Words)

  • 정창부;곽희규;정선화;김수형
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2000년도 추계학술발표논문집 (상)
    • /
    • pp.293-296
    • /
    • 2000
  • 본 논문에서는 주제어 인식에 기반한 문서영상의 검색 및 색인 시스템에 적용하기 위한 단어 단위 분한 시스템을 제안한다. 제안 시스템은 영상 전처리, 문서 구조 분석을 통해 추출된 텍스트 영역을 입력으로 단어 단위 분할을 수행하는데, 텍스트 영역에 대해 텍스트 라인을 분할하고 분할된 텍스트 라인을 단어 단위로 분할하는 계층적 접근 방법을 사용한다. 텍스트라인 분할은 수평 방향 투영 프로파일을 적용하여 분할 지점을 구한다. 그리고 단어 분할은 연결요소들을 추출한 후 연결요소간의 gap 정보를 구하고, gap 군집화 기법을 사용하여 단어 단위 분한 지점을 구한다. 이때 단어 단위 분할의 성능을 저하시키는 특수기호에 대해서는 휴리스틱 정보를 이용하여 검출한다. 제안 시스템의 성능 평가는 50개의 텍스트 영역에 적용하여 99.83%의 정확도를 얻을 수 있었다.

  • PDF

저해상도 팩스 표지 영상의 구조 분석 (Structure Analysis of Low Contrast Fax Cover Pages)

  • 임영규;이성환
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1998년도 가을 학술발표논문집 Vol.25 No.2 (2)
    • /
    • pp.387-389
    • /
    • 1998
  • 팩스가 보편적인 정보 전달 매체로 자리잡게 됨에 따라 기업체나 관공서 뿐만 아니라 가정에서도 많은 작업이 팩스를 통해 이루어지게 되었다. 이에 따라 팩스 문서의 분석 및 인식의 필요성이 증가하게 되었다. 팩스 문서는 표지와 내용이 두 부분으로 이루어지는데 팩스 문서의 처리를 위해서는 성명, 주소등을 포함하는 팩스 표지의 분석이 중요하다. 따라서 본 논문에서는 팩스 표지 영상의 구조 분석 방법을 제안한다. 제안한 팩스 표지 구조 분석 방법은 팩스 표지가 헤드, 송/수신 정보, 메시지로 구성된다는 점에 착안하여 위치 정보를 이용한 영역 분리에 중점을 두었으며, 팩스 표지의 종류를 몇 가지로 분류하여 도표 형태의 팩스 표지도 분석이 가능하도록 하였다. 분자 인식에서는 팩스 문자 인식에 우수한 성능을 보이고 있는 자소 기반 한글 문자 인식기를 사용하였다. 또한 한글의 자소 모델에 기반한 후처리 방법을 개발하여 인식 오류를 교정하였다.

  • PDF

한글 문서 영상에서의 문자와 비문자의 분리 추출

  • 이종국;김항준
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1990년도 제2회 한글 및 한국어정보처리 학술대회
    • /
    • pp.219-219
    • /
    • 1990
  • 본 논문에서는 국제 컴퓨터 망을 통하여 한글 정보를 전송할 수 있는 한 방안을 제안하였다. 한글 문서를 서구 문자로 바꾸어 서구문만의 전송이 가능한 컴퓨터 망에서도 전송이 가능하도록 하였고 한글과 영문이 혼용된 문서를 서구 문자로 전자하는데 한/영 구분기호를 사용하였으며 전자된 한글이 포함되어 있음을 표현하는 통신문 서식을 만들어 사용하였다. 또한 한글을 서구문자로 전자하고 복원하는 소프트웨어를 작성하였다.

  • PDF

문서 이미지를 위한 디지털 워터마킹 (Digital Watermarking for Document Image)

  • 이덕;최종욱
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2003년도 봄 학술발표논문집 Vol.30 No.1 (A)
    • /
    • pp.464-466
    • /
    • 2003
  • 전자정부, 전자상거래의 활성화로 디지털 문서가 빠른 속도로 유통되고 있기에 이에 대한 효과적인 보호대척이 필요한 실정이다. 본 논문에서는 Window Pattern을 이용하여 문서 이미지에 저작권 정보를 삽입하는 방안을 제안한다. 삽입대상 Window Patte을 결정하고 이러한 Pattern으로 원본 영상을 Scan하면서 픽셀 값에 변화를 주게 된다. 이렇게 되어 하나의 Pattern에 1 bit의 정보의 삽입이 가능하게 되고 추출 시 원본은 필요로 하지 않으며 실용성이 높고 적용분야도 넓다.

  • PDF

HOG 기반의 적응적 평활화를 이용한 스캔된 영상의 하프톤 잡음 제거 (Halftone Noise Removal in Scanned Images using HOG based Adaptive Smoothing Filter)

  • 허규성;백열민;김회율
    • 방송공학회논문지
    • /
    • 제17권2호
    • /
    • pp.316-324
    • /
    • 2012
  • 본 논문에서는 영상의 그래디언트의 히스토그램 (HOG)에 기반한 적응적 평활화 필터를 이용하여 스캔된 하프톤 문서의 하프톤 잡음 제거 방법을 제안한다. 하프톤 잡음은 잡음의 편차가 커서 에지 영역과 유사한 특성을 나타내므로 일반적인 에지 보존 평활화 필터를 적용할 경우에는 잡음 제거 효과가 떨어진다. 또한 인쇄물에 주로 사용되는 집중형 도트 방식의 하프톤은 컬러 영상에서 채널간의 간섭 현상으로 인해 모아레 패턴을 생성한다. 따라서 본 논문에서는 스캔된 하프톤 문서의 하프톤 잡음과 모아레 패턴을 효과적으로 제거하기 위해 하프톤 잡음의 방향성에 기반한 적응적 평활화 필터 방법을 제안한다. 하프톤 잡음의 경우 영상의 에지와 달리 등방성을 가지므로 영상을 블록 단위로 나누어 지배적인 에지의 크기와 방향성을 살핌으로써 적응적 평활화 필터를 구성할 수 있다. 실험 결과, 제안하는 방법은 다양한 인쇄 매체를 통해 생성된 하프톤 문서에 대하여 효과적으로 하프톤 잡음을 제거하면서도 영상의 에지를 보존하는 것을 확인할 수 있었다.

복합문서 개체 검색 시스템- [IN2] DOR (Composite Document Object Retrieval and Searching System-[IN2] DOR)

  • 안태성;임중수;김명훈;안우람;이경일
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2003년도 제15회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.113-118
    • /
    • 2003
  • 기존 문서 검색 시스템의 경우 단순히 문서 내에서 텍스트를 추출한 후 그 텍스트를 색인, 검색하는 형태를 가지고 있었다. 본 논문에서는 MS Word, Excel, HWP 등 다양한 형태의 문서에서 텍스트, 표, 이미지, 차트, 동영상 등의 문서 개체를 분석, 색인하고 이를 검색하는 시스템의 개발 방법을 제외하였다. 제안된 시스템은 문서의 내부 자료 구조를 CDML(Composite Document Markup Language)로 변환하고, 이를 색인, 저장함으로 기존의 전문 검색 시스템의 한계를 효과적으로 극복했으며, 문서 내의 검색 대상 개체로 자동 이동하고 하일라이팅 시키는 기술을 구현함으로 사용자 편익성을 높였다. 개발된 시스템의 성능을 평가한 결과, 다양한 문서 형식에 대해 평균 97% 이상의 CDML변환 성공률과 개체 검색 성공률을 보였으며, 이진 파일에서 직접 개체를 추출함으로 매우 높은 분석 및 색인 속도가 달성되었음을 확인할 수 있었다. 본 논문에서 소개된 새로운 패러다임의 문서 검색 솔루션을 통해 다양한 기술적 상업적 파급 효과가 기대되고 있다.

  • PDF

ICT를 활용한 일본어 교육에서 문장 표기 형식이 영상문자 낭독 및 내용 파악에 미치는 효과 (The Effect of Orthography on Electronic Character Reading and Comprehending Ability in Japanese Education using ICT)

  • 강신철;김민기
    • 컴퓨터교육학회논문지
    • /
    • 제7권6호
    • /
    • pp.85-93
    • /
    • 2004
  • 본 연구에서는 프로젝션 TV와 컴퓨터 화면에 제시되는 일본어 영상문자 읽기 수업을 위한 적합한 화면 환경을 살펴보았다. 그리고 복수표기, 띄어쓰기 등 실제 일본 웹 사이트에 나타나는 일본어 표기 형식에 대한 사전 학습활동이 웹 문서의 내용 파악에 어떠한 영향을 미치는지를 실험을 통해 살펴보았다. 실험 결과 제7차 교육과정에 새롭게 추가된 일본 웹 문서의 독해 능력을 배양하기 위하여 두 가지 조치가 필요함을 알 수 있었다. 단기적으로는 실제 일본어 웹 사이트의 문서를 학습 자료로 활용할 필요가 있으며, 장기적으로는 현행 일본어 교과서의 표기 형식을 재검토할 필요가 있음을 확인할 수 있었다.

  • PDF

필터링 및 피크검출을 이용한 텍스트 추출 (Text line extraction based on filtering and peak detection)

  • 진보라;조남익
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송공학회 2013년도 추계학술대회
    • /
    • pp.41-42
    • /
    • 2013
  • 본 논문에서는 문서 영상 처리의 중요한 전처리 과정인 텍스트 라인 추출을 위하여 가우시안 필터링 및 피크 검출을 이용하는 방법을 제안한다. 이는 문서 영상 내의 글자 영역의 픽셀 강도와 텍스트 라인 사이의 간격에 해당하는 강도의 차이로 인해 문서 영상의 각 열마다 높은 피크와 낮은 피크가 번갈아 가며 나타나는 것에 기반으로, 제안하는 알고리즘은 필터 스케일 추정, 필터량 및 피크 검출, 라인 성분 그룹화의 세 단계로 구성된다. 필터 스케일 추정 단계에서는 여러 초기 값으로 필터링하여 피크 차이 간의 히스토그램을 만듦으로써 글자 크기를 대략적으로 예축하며, 필터링 및 피크 검출 단계에서 앞서 예측된 스케일의 가우시안 필터를 이용하여 필터링 한 후, 각각의 열마다 피크를 검출한다. 마지막으로 라인 성분 그룹화를 통하여 검출된 피크를 서로 연결하여 하나의 텍스트 라인을 구성하는 성분들로 그룹화시켜 텍스트 라인을 추출한다. 실험 결과를 통하여, 제안하는 알고리즘은 이진화 과정을 거치지 않음으로써 균일하지 못한 조명환경 등으로 이진화 성능이 좋지 못할 경우에도 텍스트 라인을 추출할 수 있으며, 텍스트 라인 간격이 인정하지 않고 휘어진 라인을 포함하는 경우에도 적용할 수 있음을 확인 할 수 있다.

  • PDF