• Title/Summary/Keyword: 정보추출

Search Result 14,072, Processing Time 0.041 seconds

Information Extraction Using the Ontology (온톨로지를 이용한 정보 추출)

  • Kim, In-Su;Lee, Bog-Ju
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2005.07b
    • /
    • pp.652-654
    • /
    • 2005
  • 정보 추출은 텍스트로 되어 있는 비 정형화된 데이터로부터 정형화된 정보를 추출하는 분야이다. 기존의 정보 추출이 구문 중심의 방법인데 비해 본 논문에서는 시맨틱 웹과 온톨로지를 이용한 의미 기반의 정보 추출을 시도한다. 또한 본 논문에서는 기존의 정보 추출 모델을 분류해 보고 반자동 정보 추출이라는 새로운 모델을 제시한다. 이 모델에 기반하여 개인 정보를 자동으로 정형화 시켜주는 정보 추출 도구를 개발하고 이를 소개한다.

  • PDF

Information Extraction form newspaper article by recognizing 5W1H elements (신문기사에서 육하원칙 중심의 정보 추출)

  • 이현주;김계성;구상옥;이상조
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2001.04b
    • /
    • pp.361-363
    • /
    • 2001
  • 본 논문은 신문 기사문에 특정적인 정보 추출의 내용과 방법을 제안한다. 신문 기사에서 이용자가 원하는 정보 추출의 내용으로 육하원칙을 중심으로 한 다섯 가지 정보를 제시하였으며, 이를 추출하기 위해 통계적인 기법을 주로 이용하고 부분적으로 언어적 지식을 이용하였다. 본 논문에서는 비교적 문서의 길이가 짧은 신문기사문을 요약 대상으로 하므로 단락이나 문장이 아닐 절 이하 단위로 추출하며, 중심절을 추출한 뒤 그 절과의 관계를 통해 나머지 정보들을 추출함으로써 추출되는 내용이 유사하거나 산만하지 않기 때문에 이 추출 정보로 요약문을 생성할 경우에 긴밀한 요약문을 생성할 수 있다.

  • PDF

Automatic Information Extraction for Structured Web Documents (구조화된 웹 문서에 대한 자동 정보추출)

  • Yun, Bo-Hyun
    • Journal of Internet Computing and Services
    • /
    • v.6 no.3
    • /
    • pp.129-145
    • /
    • 2005
  • This paper proposes the web information extraction system that extracts the pre-defined information automatically from web documents (i.e, HTML documents) and integrates the extracted information, The system recognizes entities without lables by the probabilistic based entity recognition method and extends the existing domain knowledge semiautomatically by using the extracted data, Moreover, the system extracts the sub-linked information linked to the basic page and integrates the similar results extracted from heterogeneous sources, The experimental result shows that the system extracts the sub-linked information and uses the probabilistic based entity recognition enhances the precision significantly against the system using only the domain knowledge, Moreover, the presented system can the more various information precisely due to applying the system with flexibleness according to domains, Because bath the semiautomatic domain knowledge expansion and the probabilistic based entity recognition improve the quality of the information, the system can increase the degree of user satisfaction at its maximum. Thus, this system can satisfy the intellectual curiosity of users from movie sites, performance sites, and dining room sites, We can construct various comparison shopping mall and contribute the revitalization of e-business.

  • PDF

Automatic Wrapper Generating Agent based on XML (XML 기반의 Wrapper 자동 생성 에이전트)

  • 서희경;양재영;정현섭;최중민
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2000.10b
    • /
    • pp.48-50
    • /
    • 2000
  • 본 논문은 사용자를 대신해서 웹상의 여러 곳에 존재하는 정보를 추출하고 통합하여 사용자에게 제공하기 위한 에이전트 시스템을 설계하고자 한다. 정확한 정보 추출을 위해서는 추출하고자 하는 정보의 위치를 찾아내는 정보 추출 규칙이 요구된다. 이러한 규칙을 알아내기 위해서 본 논문에서 제안하는 시스템은 XML로 기술된 도메인 지식을 이용한다. 이 도메인 지식은 논리적 라인의 의미 분석에 사용되며, 논리적 라인의 의미를 기반으로 도메인 문서에서 추출해야 하는 정보의 패턴을 학습한다. 학습된 패턴에서 XML로 기술된 규칙을 생성하는데, 이 규칙은 Wrapper이 된다. 이렇게 생성된 규칙을 이용해서 정보를 추출하게 되며, 추출된 정보를 통합해서 사용자에게 제공하게 된다.

  • PDF

The Lines Extraction and Analysis of The Palm using Fuzzy Binarization and Fuzzy Reasoning Rule (퍼지 이진화와 퍼지 추론 기법을 이용한 손금 추출 및 분석)

  • Jang, Su-Jae;Kim, Kwang-Beak
    • Proceedings of the Korean Institute of Information and Commucation Sciences Conference
    • /
    • 2010.10a
    • /
    • pp.179-182
    • /
    • 2010
  • 본 논문에서는 영상으로부터 손금을 추출하기 위해서 획득된 영상을 YCbCr 컬러 공간으로 변환한다. YCbCr 컬러 공간에서 Y:65~255, Cb:25~255, Cr:130~255에 해당되는 피부색 정보를 추출하고 이 피부색 정보를 임계치로 설정하여 손 영역을 추출한다. 추출된 손 영역에서 내부 픽셀의 3:1 이상, 전체 영상의 2:1 이상인 손의 형태학적 정보와 8 방향 윤곽선 추적 기법을 이용하여 잡음을 제거한다. 잡음이 제거된 영상에서 손금을 추출하기 위해서 스트레칭 기법과 소벨 마스크를 이용하여 에지를 추출한다. 추출된 에지 영상에서도 미세한 잡음이 존재하므로 퍼지 이진화 기법을 이용하여 효과적으로 이진화 한다. 이진화된 영상에서 손금의 형태학적 정보를 이용하여 손의 윤곽선을 제외한 손금 영역을 추출한다. 추출된 손금 영역은 동치 테이블을 이용하는 연결 영역 검색 기법과 퍼지 추론 기법을 적용하여 개별 손금의 중요선을 추출하고 분석한다. 다양한 손금 영상을 대상으로 실험한 결과, 제안된 방법이 기존의 손금 추출 방법보다 손금을 분석하는데 효율적인 것을 확인하였다.

  • PDF

Face Region Extraction for the Facial Expression Recognition System (얼굴 표정 인식 시스템을 위한 얼굴 영역 추출)

  • Lim Ju-Hyuk;Song Kun-Woen
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2004.11a
    • /
    • pp.903-906
    • /
    • 2004
  • 본 논문에서는 얼굴 표정 인식 시스템을 위한 얼굴 영역 추출 알고리즘을 제안한다. 이는 입력 영상으로부터 얼굴 후보 영역을 추출하고, 추출된 얼굴 후보 영역에서 눈의 위치를 정확히 추출한다. 그리고 추출된 눈 영역들의 정보와 타원 방정식을 이용하여 최종 얼굴 영역을 추출한다. 얼굴 후보 영역은 HSI 칼라 좌표계에 기반한 적응적 피부색 구간 범위를 설정하여 추출하였다. 추출된 얼굴 후보 영역에서의 눈 영역 추출을 위해 밝기 정보를 이용하여 먼저 눈의 후보 화소들을 추출하고, 레이블링 과정을 통하여 영역별로 그룹화하였다. 각 후보 영역들의 화소 수, 가로세로비 및 위치 정보를 고려하여 최종 눈 영역을 추출하였다. 추출된 두 눈 영역에서 무게중심을 구하고 이를 이용하여 장축과 단축을 설정하여 타원방정식을 이용 최종 얼굴 영역을 추출하였다. 제안된 알고리즘은 조명 변화, 다양한 배경들을 가지는 얼굴 영상에서도 정확히 얼굴 영역을 추출할 수 있었다.

  • PDF

Korean Noun Extraction Using Exclusive Segmentation Information and Post-noun morpheme sequences (분석 배제 정보와 후절어를 이용한 한국어 명사추출)

  • 이도길;류원호;임해창
    • Proceedings of the Korean Society for Cognitive Science Conference
    • /
    • 2000.06a
    • /
    • pp.19-25
    • /
    • 2000
  • 명사 추출기는 정보검색, 문서분류, 문서요약, 정보추출 등의 분야에서 사용되고 있으며, 정확한 명사 추출과 빠른 색인 속도는 이들 시스템 성능과 밀접한 관계가 있다. 한국어에서 명사를 추출하기 위해서는 형태소 분석이 필요한데, 본 논문에서는 대량의 품사부착된 말뭉치로부터 추출한 분석배제 정보와 후절어를 이용함으로써 형태소 분석을 생략하거나 보다 단순한 처리에 의해 명사를 추출하는 방법을 제안한다. 실험결과에 의하면, 제안된 방법에 의한 명사추출기는 비교적 높은 정확률과 재현율을 나타내며, 빠른 속도를 보였다.

  • PDF

Extracting Domain Related Multi-word Terms using Seeds (시드를 이용한 도메인 관련 복합어 추출 기법)

  • 조성원;최종필;김민구
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2004.10a
    • /
    • pp.166-168
    • /
    • 2004
  • 복합어 추출 기법은 최근 활발한 연구가 진행되고 있는 온톨로지 구축과 정보 검색에 중요한 기법으로 연구되어 왔다. 초기의 연구는 주로 언어학적인 필터 기법이나 통계적 기법을 사용하였지만, 최근 문맥정보와 의미 사전 등을 이용하여 용어를 추출하는 방법으로 발전해 오고 있다. 또한 정보검색 분야와 온톨로지 분야에서도 모든 용어를 추출하는 방법보다 문서 집합의 도메인에 적합하다고 판단되는 용어들을 추출하는 방법이 그 성능을 향상시킬 수 있다. 본 논문에서는 통계학적 방법을 이용하여 도메인에 적합한 시드 용어의 추출을 하고, 그 시드 용어를 이용해 가중치를 정제하는 방법과 시드 용어로부터 관련된 용어를 추출해 나가는 방법을 적용하여 문서 집합의 도메인에 맞는 용어들을 추출하고자 한다.

  • PDF

Extraction of Face and Components Using Color, Contour, and Structural Information of Face (얼굴의 색상, 윤곽선, 구조적 정보를 이용한 얼굴 및 구성요소 추출)

  • 선영범;김진태
    • Proceedings of the Korea Multimedia Society Conference
    • /
    • 2001.06a
    • /
    • pp.142-145
    • /
    • 2001
  • 본 논문에서는 얼굴추출을 하는데 있어서 빠른 속도로 얼굴의 구성요소들을 분할하고 추출한다. 효율적인 분할과 추출물 위해서 3가지의 정보를 사용한다. 첫 번째는 얼굴의 색상정보로써 배경 속의 얼굴을 찾는데 이용한다. 두 번째는 얼굴의 윤곽선 정보로 얼굴의 구성요소를 추출해 내는데 사용한다. 세 번째는 얼굴의 구조적인 정보를 이용하여 색상 및 윤곽선 정보를 이용하여 추출된 요소에 대해 얼굴의 다른 구성요소를 추출하는데 이용한다.

  • PDF

Scheme about extracting feature points by using edge information and Scale Space Filtering (에지정보와 Scale Space 필터를 이용한 특징점 추출 기법)

  • 김정학;박영태
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2002.10d
    • /
    • pp.565-567
    • /
    • 2002
  • 동영상에서 특정 물체를 추적하기 위하여 여러 가지 알고리즘이 적용된다. 그 중에서 특징점을 추출하고 정합하여, 움직이고 있는 물체를 추적하는 방법을 소개한다. 특징점을 추출하는 방법 중에서 에지정보를 이용하는 방법과 직접 이미지에 접근하는 방식이 있다. 본 논문에서는 물체의 에지정보를 이용하여 특징점을 추출하는 기법을 제안한다. 널리 이용되고 있는 Canny Edge Detection(1) 알고리즘 이용, 에지를 얻게 되는데, 여기서 특징점 추출에 오류를 발생시킬 수 있는 경우에 대비하여 에지를 보정하고, 결과의 에지에서 특징 점을 추출한다. 보정된 에지정보에서 시작점, 끝점, 둘 이상의 에지가 모인 분기점과 굴곡률이 국부 최대인 지점을 찾아 특징점을 추출한다.

  • PDF