• 제목/요약/키워드: 정보추출

검색결과 14,050건 처리시간 0.045초

온톨로지를 이용한 정보 추출 (Information Extraction Using the Ontology)

  • 김인수;이복주
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2005년도 한국컴퓨터종합학술대회 논문집 Vol.32 No.1 (B)
    • /
    • pp.652-654
    • /
    • 2005
  • 정보 추출은 텍스트로 되어 있는 비 정형화된 데이터로부터 정형화된 정보를 추출하는 분야이다. 기존의 정보 추출이 구문 중심의 방법인데 비해 본 논문에서는 시맨틱 웹과 온톨로지를 이용한 의미 기반의 정보 추출을 시도한다. 또한 본 논문에서는 기존의 정보 추출 모델을 분류해 보고 반자동 정보 추출이라는 새로운 모델을 제시한다. 이 모델에 기반하여 개인 정보를 자동으로 정형화 시켜주는 정보 추출 도구를 개발하고 이를 소개한다.

  • PDF

신문기사에서 육하원칙 중심의 정보 추출 (Information Extraction form newspaper article by recognizing 5W1H elements)

  • 이현주;김계성;구상옥;이상조
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2001년도 봄 학술발표논문집 Vol.28 No.1 (B)
    • /
    • pp.361-363
    • /
    • 2001
  • 본 논문은 신문 기사문에 특정적인 정보 추출의 내용과 방법을 제안한다. 신문 기사에서 이용자가 원하는 정보 추출의 내용으로 육하원칙을 중심으로 한 다섯 가지 정보를 제시하였으며, 이를 추출하기 위해 통계적인 기법을 주로 이용하고 부분적으로 언어적 지식을 이용하였다. 본 논문에서는 비교적 문서의 길이가 짧은 신문기사문을 요약 대상으로 하므로 단락이나 문장이 아닐 절 이하 단위로 추출하며, 중심절을 추출한 뒤 그 절과의 관계를 통해 나머지 정보들을 추출함으로써 추출되는 내용이 유사하거나 산만하지 않기 때문에 이 추출 정보로 요약문을 생성할 경우에 긴밀한 요약문을 생성할 수 있다.

  • PDF

구조화된 웹 문서에 대한 자동 정보추출 (Automatic Information Extraction for Structured Web Documents)

  • 윤보현
    • 인터넷정보학회논문지
    • /
    • 제6권3호
    • /
    • pp.129-145
    • /
    • 2005
  • 본 논문에서는 구조화된 웹문서에서 자동으로 정보를 추출하고 추출된 정보를 통합하는 정보추출 시스템을 제안한다. 제안한 시스템은 레이블(label)이 없는 엔티티를 인식하기 위해 확률 기반 엔티티 인식 방법을 이용하며, 추출된 데이터를 이용하여 기존의 도메인 지식을 반자동으로 확장하는 기능을 제공한다. 게다가 기본 페이지에 링크된 하위 링크의 정보를 추출하는 기능을 제공하며, 도메인에 대한 이종의 정보 소스로부터 얻어진 유사 추출 결과를 통합하는 기능을 제공한다. 실험 결과, 도메인 지식만을 이용하여 웹 정보추출 시스템을 평가하였을 경우의 성능에 비해 하위링크의 정보를 추출하거나 확률 기반으로 레이블을 추론하여 추출 시스템을 평가한 경우의 성능이 상당히 향상됨을 보인다. 아울러 본 논문에서 제안하는 웹 정보추출 시스템은 도메인별로 시스템을 융통성 있게 적용시킬 수 있기 때문에 보다 다양한 정보들을 추출할 수 있다. 자동 도메인 지식의 확장이나 확률적 엔티티 인식 방법은 도메인 지식을 이용하는 프로그램이 추출할 수 있는 정보의 질을 증대시키기 때문에, 사용자의 만족도를 극대화시킬 수 있다는 장점이 있다. 따라서 본 시스템은 인터넷상의 영화 사이트나 공연 사이트 혹은 음식점 사이트에 대해서 정보를 추출해서 사용자의 지적 호기심을 충족시켜줄 수 있을 뿐만 아니라, 다양한 비교 시스템을 구축할 수 있기 때문에 전자 상거래의 활성화에도 기여한다.

  • PDF

XML 기반의 Wrapper 자동 생성 에이전트 (Automatic Wrapper Generating Agent based on XML)

  • 서희경;양재영;정현섭;최중민
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2000년도 가을 학술발표논문집 Vol.27 No.2 (2)
    • /
    • pp.48-50
    • /
    • 2000
  • 본 논문은 사용자를 대신해서 웹상의 여러 곳에 존재하는 정보를 추출하고 통합하여 사용자에게 제공하기 위한 에이전트 시스템을 설계하고자 한다. 정확한 정보 추출을 위해서는 추출하고자 하는 정보의 위치를 찾아내는 정보 추출 규칙이 요구된다. 이러한 규칙을 알아내기 위해서 본 논문에서 제안하는 시스템은 XML로 기술된 도메인 지식을 이용한다. 이 도메인 지식은 논리적 라인의 의미 분석에 사용되며, 논리적 라인의 의미를 기반으로 도메인 문서에서 추출해야 하는 정보의 패턴을 학습한다. 학습된 패턴에서 XML로 기술된 규칙을 생성하는데, 이 규칙은 Wrapper이 된다. 이렇게 생성된 규칙을 이용해서 정보를 추출하게 되며, 추출된 정보를 통합해서 사용자에게 제공하게 된다.

  • PDF

퍼지 이진화와 퍼지 추론 기법을 이용한 손금 추출 및 분석 (The Lines Extraction and Analysis of The Palm using Fuzzy Binarization and Fuzzy Reasoning Rule)

  • 장수재;김광백
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2010년도 추계학술대회
    • /
    • pp.179-182
    • /
    • 2010
  • 본 논문에서는 영상으로부터 손금을 추출하기 위해서 획득된 영상을 YCbCr 컬러 공간으로 변환한다. YCbCr 컬러 공간에서 Y:65~255, Cb:25~255, Cr:130~255에 해당되는 피부색 정보를 추출하고 이 피부색 정보를 임계치로 설정하여 손 영역을 추출한다. 추출된 손 영역에서 내부 픽셀의 3:1 이상, 전체 영상의 2:1 이상인 손의 형태학적 정보와 8 방향 윤곽선 추적 기법을 이용하여 잡음을 제거한다. 잡음이 제거된 영상에서 손금을 추출하기 위해서 스트레칭 기법과 소벨 마스크를 이용하여 에지를 추출한다. 추출된 에지 영상에서도 미세한 잡음이 존재하므로 퍼지 이진화 기법을 이용하여 효과적으로 이진화 한다. 이진화된 영상에서 손금의 형태학적 정보를 이용하여 손의 윤곽선을 제외한 손금 영역을 추출한다. 추출된 손금 영역은 동치 테이블을 이용하는 연결 영역 검색 기법과 퍼지 추론 기법을 적용하여 개별 손금의 중요선을 추출하고 분석한다. 다양한 손금 영상을 대상으로 실험한 결과, 제안된 방법이 기존의 손금 추출 방법보다 손금을 분석하는데 효율적인 것을 확인하였다.

  • PDF

얼굴 표정 인식 시스템을 위한 얼굴 영역 추출 (Face Region Extraction for the Facial Expression Recognition System)

  • 임주혁;송근원
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2004년도 추계학술발표논문집(상)
    • /
    • pp.903-906
    • /
    • 2004
  • 본 논문에서는 얼굴 표정 인식 시스템을 위한 얼굴 영역 추출 알고리즘을 제안한다. 이는 입력 영상으로부터 얼굴 후보 영역을 추출하고, 추출된 얼굴 후보 영역에서 눈의 위치를 정확히 추출한다. 그리고 추출된 눈 영역들의 정보와 타원 방정식을 이용하여 최종 얼굴 영역을 추출한다. 얼굴 후보 영역은 HSI 칼라 좌표계에 기반한 적응적 피부색 구간 범위를 설정하여 추출하였다. 추출된 얼굴 후보 영역에서의 눈 영역 추출을 위해 밝기 정보를 이용하여 먼저 눈의 후보 화소들을 추출하고, 레이블링 과정을 통하여 영역별로 그룹화하였다. 각 후보 영역들의 화소 수, 가로세로비 및 위치 정보를 고려하여 최종 눈 영역을 추출하였다. 추출된 두 눈 영역에서 무게중심을 구하고 이를 이용하여 장축과 단축을 설정하여 타원방정식을 이용 최종 얼굴 영역을 추출하였다. 제안된 알고리즘은 조명 변화, 다양한 배경들을 가지는 얼굴 영상에서도 정확히 얼굴 영역을 추출할 수 있었다.

  • PDF

분석 배제 정보와 후절어를 이용한 한국어 명사추출 (Korean Noun Extraction Using Exclusive Segmentation Information and Post-noun morpheme sequences)

  • 이도길;류원호;임해창
    • 한국인지과학회:학술대회논문집
    • /
    • 한국인지과학회 2000년도 한글 및 한국어 정보처리
    • /
    • pp.19-25
    • /
    • 2000
  • 명사 추출기는 정보검색, 문서분류, 문서요약, 정보추출 등의 분야에서 사용되고 있으며, 정확한 명사 추출과 빠른 색인 속도는 이들 시스템 성능과 밀접한 관계가 있다. 한국어에서 명사를 추출하기 위해서는 형태소 분석이 필요한데, 본 논문에서는 대량의 품사부착된 말뭉치로부터 추출한 분석배제 정보와 후절어를 이용함으로써 형태소 분석을 생략하거나 보다 단순한 처리에 의해 명사를 추출하는 방법을 제안한다. 실험결과에 의하면, 제안된 방법에 의한 명사추출기는 비교적 높은 정확률과 재현율을 나타내며, 빠른 속도를 보였다.

  • PDF

시드를 이용한 도메인 관련 복합어 추출 기법 (Extracting Domain Related Multi-word Terms using Seeds)

  • 조성원;최종필;김민구
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 가을 학술발표논문집 Vol.31 No.2 (1)
    • /
    • pp.166-168
    • /
    • 2004
  • 복합어 추출 기법은 최근 활발한 연구가 진행되고 있는 온톨로지 구축과 정보 검색에 중요한 기법으로 연구되어 왔다. 초기의 연구는 주로 언어학적인 필터 기법이나 통계적 기법을 사용하였지만, 최근 문맥정보와 의미 사전 등을 이용하여 용어를 추출하는 방법으로 발전해 오고 있다. 또한 정보검색 분야와 온톨로지 분야에서도 모든 용어를 추출하는 방법보다 문서 집합의 도메인에 적합하다고 판단되는 용어들을 추출하는 방법이 그 성능을 향상시킬 수 있다. 본 논문에서는 통계학적 방법을 이용하여 도메인에 적합한 시드 용어의 추출을 하고, 그 시드 용어를 이용해 가중치를 정제하는 방법과 시드 용어로부터 관련된 용어를 추출해 나가는 방법을 적용하여 문서 집합의 도메인에 맞는 용어들을 추출하고자 한다.

  • PDF

얼굴의 색상, 윤곽선, 구조적 정보를 이용한 얼굴 및 구성요소 추출 (Extraction of Face and Components Using Color, Contour, and Structural Information of Face)

  • 선영범;김진태
    • 한국멀티미디어학회:학술대회논문집
    • /
    • 한국멀티미디어학회 2001년도 춘계학술발표논문집
    • /
    • pp.142-145
    • /
    • 2001
  • 본 논문에서는 얼굴추출을 하는데 있어서 빠른 속도로 얼굴의 구성요소들을 분할하고 추출한다. 효율적인 분할과 추출물 위해서 3가지의 정보를 사용한다. 첫 번째는 얼굴의 색상정보로써 배경 속의 얼굴을 찾는데 이용한다. 두 번째는 얼굴의 윤곽선 정보로 얼굴의 구성요소를 추출해 내는데 사용한다. 세 번째는 얼굴의 구조적인 정보를 이용하여 색상 및 윤곽선 정보를 이용하여 추출된 요소에 대해 얼굴의 다른 구성요소를 추출하는데 이용한다.

  • PDF

에지정보와 Scale Space 필터를 이용한 특징점 추출 기법 (Scheme about extracting feature points by using edge information and Scale Space Filtering)

  • 김정학;박영태
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2002년도 가을 학술발표논문집 Vol.29 No.2 (2)
    • /
    • pp.565-567
    • /
    • 2002
  • 동영상에서 특정 물체를 추적하기 위하여 여러 가지 알고리즘이 적용된다. 그 중에서 특징점을 추출하고 정합하여, 움직이고 있는 물체를 추적하는 방법을 소개한다. 특징점을 추출하는 방법 중에서 에지정보를 이용하는 방법과 직접 이미지에 접근하는 방식이 있다. 본 논문에서는 물체의 에지정보를 이용하여 특징점을 추출하는 기법을 제안한다. 널리 이용되고 있는 Canny Edge Detection(1) 알고리즘 이용, 에지를 얻게 되는데, 여기서 특징점 추출에 오류를 발생시킬 수 있는 경우에 대비하여 에지를 보정하고, 결과의 에지에서 특징 점을 추출한다. 보정된 에지정보에서 시작점, 끝점, 둘 이상의 에지가 모인 분기점과 굴곡률이 국부 최대인 지점을 찾아 특징점을 추출한다.

  • PDF