• 제목/요약/키워드: 텍스트 검색

검색결과 684건 처리시간 0.03초

지식지향적 조직에 있어서의 지식평가 및 공유방법에 관한 연구 (A Study on the Knowledge Measurement md Sharing Methodology at the Knowledge-Oriented Organization)

  • 이상근;유상진;장영택
    • 한국산업정보학회논문지
    • /
    • 제6권3호
    • /
    • pp.1-19
    • /
    • 2001
  • 웹 서비스를 기반으로 한 인터넷은 비약적으로 발전하고 있으며, 차세대 웹 표준화를 위한 노력이 전세계적으로 진행 중에 있다. 처음 개발된 당시 웹은 텍스트 기반의 구조에 맞추어 HTTP, HTML, URL이 제안되어 이를 통해 비동기적인 형태의 검색과 단순하고 단일한 방식의 표현 방식을 사용해 왔다. 그러나 최근 인터넷 상의 상당수의 데이터들은 보다 복잡해지고 구조화되어 가고 있으며, 동기적인 멀티미디어 정보를 포함하는 등 새로운 구조 및 표현 방식을 요구하게 되었다. W3C의 사용자 인터페이스 도메인 중 멀티미디어 동기화 그룹에서 현재 표준화 작업중인 언어는 SMIL로 SMIL은 웹 상에서 멀티미디어 요소들이 잘 통합되어 어느 위치에서 얼마동안 표현되는지를 기술하는 XML-기반 언어이다. 본 논문에서는 SML 관련 표준화 동향 및 주요 이슈들을 연구 분석하고 기술 개발 내용에 대하여 논의한다.

  • PDF

딥러닝 기반의 뉴스 분석을 활용한 주제별 최신 연관단어 추출 기법 (A Topic Related Word Extraction Method Using Deep Learning Based News Analysis)

  • 김성진;김건우;이동호
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2017년도 춘계학술발표대회
    • /
    • pp.873-876
    • /
    • 2017
  • 최근 정보검색의 효율성을 위해 데이터를 분석하여 해당 데이터를 가장 잘 나타내는 연관단어를 추출 및 추천하는 연구가 활발히 이루어지고 있다. 현재 관련 연구들은 출현 빈도수를 사용하는 방법이나 LDA와 같은 기계학습 기법을 활용해 데이터를 분석하여 연관단어를 생성하는 방법을 제안하고 있다. 기계학습 기법은 결과 값을 찾는데 사용되는 특징들을 전문가가 직접 설계해야 하며 좋은 결과를 내는 적절한 특징을 찾을 때까지 많은 시간이 필요하다. 또한, 파라미터들을 직접 설정해야 하므로 많은 시간과 노력을 필요로 한다는 단점을 지닌다. 이러한 기계학습 기법의 단점을 극복하기 위해 인공신경망을 다층구조로 배치하여 데이터를 분석하는 딥러닝이 최근 각광받고 있다. 본 논문에서는 기존 기계학습 기법을 사용하는 연관단어 추출연구의 한계점을 극복하기 위해 딥러닝을 활용한다. 먼저, 인공신경망 기반 단어 벡터 생성기인 Word2Vec를 사용하여 다양한 텍스트 데이터들을 학습하고 룩업 테이블을 생성한다. 그 후, 생성된 룩업 테이블을 바탕으로 인공신경망의 한 종류인 합성곱 신경망을 활용하여 사용자가 입력한 주제어와 관련된 최근 뉴스데이터를 분석한 후, 주제별 최신 연관단어를 추출하는 시스템을 제안한다. 또한 제안한 시스템을 통해 생성된 연관단어의 정확률을 측정하여 성능을 평가하였다.

디스크립터 자동 할당을 위한 저자키워드의 재분류에 관한 실험적 연구 (A Study on the Reclassification of Author Keywords for Automatic Assignment of Descriptors)

  • 김판준;이재윤
    • 정보관리학회지
    • /
    • 제29권2호
    • /
    • pp.225-246
    • /
    • 2012
  • 본 연구는 국내 주요 학술 DB의 검색서비스에서 제공되고 있는 저자키워드(비통제키워드)의 재분류를 통하여 디스크립터(통제키워드)를 자동 할당할 수 있는 가능성을 모색하였다. 먼저 기계학습에 기반한 주요 분류기들의 특성을 비교하는 실험을 수행하여 재분류를 위한 최적 분류기와 파라미터를 선정하였다. 다음으로, 국내 독서 분야 학술지 논문들에 부여된 저자키워드를 학습한 결과에 따라 해당 논문들을 재분류함으로써 키워드를 추가로 할당하는 실험을 수행하였다. 또한 이러한 재분류 결과에 따라 새롭게 추가된 문헌들에 대하여 통제키워드인 디스크립터와 마찬가지로 동일 주제의 논문들을 모아주는 어휘통제 효과가 있는지를 살펴보았다. 그 결과, 저자키워드의 재분류를 통하여 디스크립터를 자동 할당하는 효과를 얻을 수 있음을 확인하였다.

전자책 환경을 위한 사회적 어노테이션 및 탐색 지원 기법 (Social Annotation and Navigation Support for Electronic Textbooks)

  • 김재경;손원성
    • 한국멀티미디어학회논문지
    • /
    • 제12권10호
    • /
    • pp.1486-1498
    • /
    • 2009
  • 최근 전자 도서관 분야에서는 기존의 종이책을 디지털 형식으로 변환할 때 원본 문서의 모든 정보를 보존 할 수 있도록 스캐닝을 통한 이미지 기반의 형식을 이용하는데 주력하여왔다. 텍스트 형식의 문서와는 달리 이미지 형식의 문서는 해당 문서가 가진 정보를 쉽게 인식하기 어렵기 때문에 사용자가 접근, 처리 및 검색 등 디지털 문서로서 이미지를 활용하는데 에는 새로운 기법이 요구된다. 본 논문에서는 이미지 기반 문서에서 사용자 정보를 입력할 수 있는 어노테이션 및 사회적 탐색 지원 기법을 적용하여 디지털 문서의 사용성을 높이고, 특히 기존 온라인 교육 시스템에서 문제적으로 지적돼온 학습자의 낮은 참여율을 제안 기법을 통하여 개선하였다. 제안 기법은 현재 대학원 수업에 적용되어 어노테이션 및 사회적 탐색기법이 학습자가 학습 자료를 보다 효율적으로 활용하고 교육 시스템의 활용성을 얼마나 높이는지에 대해 검증하였다.

  • PDF

이동 단말을 위한 HTML 문서의 변환 기법 (A HTML Document Transcoding Technique for Mobile Devices)

  • 신희숙;조수선;이동우;마평수
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2002년도 추계학술발표논문집 (하)
    • /
    • pp.2347-2350
    • /
    • 2002
  • 본 논문에서는 일반 데스크탑 PC의 디스플레이 성능에 적합하도록 작성된 유선의 웹 문서를 무선 인터넷 환경의 핸드헬드 계열 소형 단말에서도 효율적으로 표현하기 위한 변환 기법을 제시한다. 이는 기존의 단순한 텍스트 위주의 추출 및 형식의 변환과는 달리, 분석 및 변환을 위한 최소 내용 단위를 설정하고, 이들의 재배치를 통하여 원본 웹 문서의 정보를 보다 정확히 반영한다. 또한 새로운 인덱스 형식으로의 재표현을 통하여 기존의 페이지 조각과 계층적 구조의 인덱스 링크를 이용한 인터페이스보다 편리한 검색 및 페이지 이동을 제공한다. 이 기법은 보다 많은 정보를 복잡한 구조로 표현하는 현재의 웹 문서 특징을 반영하고, 이동 단말들의 고성능화 추세와 함께 화려한 무선 인터넷을 요구하는 사용자들을 고려한 것이다. 전체 변환 과정은 Layout-Forming Tag Analysis Algorithm, Component Grouping Algorithm Component Block Classification Method, Index Generation Method로 구성된다. 변환 시스템의 구성 모듈별 설계와 프로토타입의 구현을 통하여 제안하는 알고리즘 및 변환 방법을 평가하였고, 실제 웹 문서에 대한 실험 결과에서 단말의 소형 화면에 적합하게 변환된 모습을 확인하였다.

  • PDF

질의 어휘와의 근접도를 반영한 단어 그래프 기반 질의 확장 (Query Expansion based on Word Graph using Term Proximity)

  • 장계훈;이경순
    • 정보처리학회논문지B
    • /
    • 제19B권1호
    • /
    • pp.37-42
    • /
    • 2012
  • 잠정적 적합성 피드백모델은 초기 검색 결과의 상위에 순위화된 문서를 적합 문서라 가정하고, 상위문서에서 빈도가 높은 어휘를 확장 질의로 선택한다. 빈도수를 이용한 질의 확장 방법의 단점은 문서 안에서 포함된 어휘들 사이의 근접도에 상관없이 각 어휘를 독립적으로 생각한다는 것이다. 본 논문에서는 어휘빈도를 이용한 질의 확장을 대체할 수 있는 어휘 근접도를 반영한 단어 그래프 기반 질의 확장을 제안한다. 질의 어휘 주변에 발생한 어휘들을 노드로 표현하고, 어휘들 사이의 근접도를 에지의 가중치로 하여 단어 그래프를 표현한다. 반복된 연산을 통해 확장 질의를 선택함으로써 성능을 향상시키는 기법을 제안한다. 유효성 검증을 위해 웹문서 집합인 TREC WT10g 테스트 컬렉션에 대한 실험에서 언어모델 보다 MAP 평가 기준에서 6.4% 향상됨을 보였다.

세종 의존명사/대명사/수사 전자사전의 정보표상 구조 (The Representational Structure of Lexical Informations of Korean non-autonomous nouns in the Sejong Electronic Dictionary)

  • 방성원;호정은;김종인
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2001년도 제13회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.341-347
    • /
    • 2001
  • 세종전자사전이 궁극적으로 범용전자사전을 지향한다는 점에 비추어 볼 때, 텍스트 자동 분석과 생성, 정보 검색 및 자동 번역 등에 활용될 데이터베이스로서의 전자사전은 자연 언어 어휘의 내적 구조와 기능방식에 관한 정보들, 가령 음운 통사 의미 화용적 가치와 실현 조건 등에 관한 정보들을 체계적이고도 정교하게 담고 있어야만 한다. 의존명사, 대명사, 수사 범주에 속하는 언어 단위들은 단일 명사와 구별되는 어휘 통사적 속성들을 지니며, 사전의 기술 구조에는 그 정보 값들을 체계적으로 명시화할 수 있는 정보 항목과 표상 구조가 설정되어야 한다. 가령 의존명사처럼 통사 의미적 자율성을 지니지 않는 언어 요소의 경우, 어휘 관계 정보보다는 인접하는 여타 언어 단위들과의 호응관계나 결합제약 조건들이 더 중요한 정보일 수 있다. 본 사전이 체언사전의 하위사전으로 별도로 구축되는 것은 단일어 사전에서 그러한 정보들을 효과적으로 표상하기 어렵기 때문이다. 그러나 본 사전은 실제적으로는 체언사전에 통합되어 운영된다는 점에서 이중적 지위를 누린다고 하겠다.

  • PDF

ACE 관계 추출과 특징화 과정에서 성능 향상을 위한 새로운 방법(1) (A New Method for Improving Performance in ACE Relation Detect ion and Characterization)

  • 김경덕;김석환;이근배;차정원
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2005년도 제17회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.1-6
    • /
    • 2005
  • 텍스트 기반 문서의 급증으로 인해 정보 추출 기술이 더욱 중요해지고 있다 특히 최근에 활발한 연구가 진행되고 있는 개체 간 관계 추출 기술은 정보검색과 질의응답 등 많은 분야에 걸쳐 활용될 수 있는 기술이다 본 논문은 기존의 자질 기반 관계 추출 시스템의 재현율을 향상시키기 위해 WHISK 알고리즘을 도입한 시스템에 관한 것이다. WHISK 알고리즘은 문장으로부터 관계에 참여하는 개체 쌍을 추출하는 규칙을 자동으로 학습한다. 그리고 시스템은 최대 엔트로피 모델을 이용하여 WHISK에 의해 추출된 개체 쌍에 적합한 관계 유형을 파악해 낸다. 본 논문은 시스템에 사용된 WHISK 알고리즘과 최대 엔트로피 모델에 대해서 알아보고, 실제로 WHISK 알고리즘을 도입하여 관계를 가지는 개체 쌍을 추출하여 문제를 해결했을 때 어느 정도의 성능 향상이 있는지 알아본다.

  • PDF

하이퍼텍스트 정보검색에 관한 연구

  • 이영자
    • 한국도서관정보학회지
    • /
    • 제18권
    • /
    • pp.91-138
    • /
    • 1991
  • The paper describes the application areas of the hypertext and the relevance of hypertext principles to the information retrieval system. As to the techniques of the hypertext information retrieval the various navigation method including a guided tour, a history list, a browser, a book-mark, etc. are discussed. The query system is considered as the other technique to be integrated into the hypertext system for the enhancement of the interactive function of the information retrieval. Based on the theoretical background, a conceptual model of hypertext information retrieval system was constructed using GUIDE which was developed by P.J. Brown of Kent University. 16 bibliographic records from LISA of 1991(June) were used for the illustration of the basic operation of the system. Though the study could not reach the implementation level due to the absolute constraints of the time and experimental environments, further efforts will continue to develop a prototype system of a hypertext information retrieval. A few conclusions can be derived from the study : (1) The integration of the hypertext into the information retrieval system can be justified by permitting the end-users to have much stronger and more flexible interaction with the system. (2) The more the degree of the sofistication of the existing information retrieval system is the more the possibility of the development of an effective and user-oriented information retrieval system will be greater by integrating guide as a front end system to the underlying software. (3) The deep knowledge about the functions of information retrieval which can be enhanced by the hypertext could be acquired by the information retrieval specialists.

  • PDF

FDC-TCT를 이용한 웹 문서 클러스터링 성능 개선 기법 (A performance improvement methodology of web document clustering using FDC-TCT)

  • 고석범;윤성대
    • 정보처리학회논문지D
    • /
    • 제12D권4호
    • /
    • pp.637-646
    • /
    • 2005
  • 키워드를 통한 웹 검색 결과의 분류와 같은 후처리가 요구되는 문서 분류 문제에서, 기존의 문서 분류 또는 클러스터링 알고리즘을 적용하는 데에는 많은 문제가 있다 그 중에서 고려해야 할 가장 심각한 두 가지 문제가 있다. 첫째는 전문가가 관여하여 범주를 선정하는 문제이고, 둘째는 문서분류에 소요되는 수행시간이 긴 문제이다. 따라서 본 논문에서는 이행적 폐쇄 트리를 이용하여 문서 유사도 계산 횟수를 크게 줄이고, 정확도의 희생을 최소화하면서 신속한 처리가 가능한 새로운 웹 문서 클러스터링 기법을 제안하다. 또한, 제안된 기법의 효율성을 검증하기 위하여 기존의 알고리즘과 비교 평가 및 분석한다.