• Title/Summary/Keyword: 자동 키워드 추출

검색결과 108건 처리시간 0.019초

내용기반 음악검색 시스템의 비교 분석 (A Comparative Analysis of Content-based Music Retrieval Systems)

  • 노정순
    • 정보관리학회지
    • /
    • 제30권3호
    • /
    • pp.23-48
    • /
    • 2013
  • 본 연구는 웹에서 접근 가능한 내용기반 음악검색(CBMR) 시스템들을 조사하여, 탐색질의의 종류, 접근점, 입출력, 탐색기능, 데이터베이스 성격과 크기 등의 관점에서 특성을 비교 분석하고자 하였다. 비교 분석에 사용된 특성을 추출하기 위해 내용기반 음악정보의 특성과 시스템 구축에 필요한 파일의 변환, 멜로디 추출 및 분할, 색인자질 추출과 색인, 매칭에 사용되는 기술들을 선행연구로 리뷰하였다. 15개의 시스템을 분석한 결과 다음과 같은 특성과 문제점이 분석되었다. 첫째, 도치색인, N-gram 색인, 불리언 탐색, 용어절단검색, 키워드 및 어구 탐색, 음길이 정규화, 필터링, 브라우징, 편집거리, 정렬과 같은 텍스트 정보 검색 기법이 CBMR에서도 검색성능을 향상시키는 도구로 사용되고 있었다. 둘째, 시스템들은 웹에서 크롤링하거나 탐색질의를 DB에 추가하는 등으로 DB의 성장과 실용성을 위한 노력을 하고 있었다. 셋째, 개선되어야 할 문제점으로 선율이나 주선율을 추출하는데 부정확성, 색인자질을 추출할 때 사용되는 불용음(stop notes)을 탐색질의에서도 자동 제거할 필요성, 옥타브를 무시한 solfege 검색의 문제점 등이 분석되었다.

퍼지추론을 이용한 소수 문서의 대표 키워드 추출 (Representative Keyword Extraction from Few Documents through Fuzzy Inference)

  • 노순억;김병만;허남철
    • 한국지능시스템학회논문지
    • /
    • 제11권9호
    • /
    • pp.837-843
    • /
    • 2001
  • 본 논문은 사용자의 관심 내용을 포함하는 소수 문서들로부터 대표 용어들을 추출하고 가중치를 부여하는 새로운 방법을 제시한다. 대표 용어들의 추출 방법에서는 우선 예제 문서들로부터 후보 용어들을 추출하고 퍼지 추론을 적용하여 초기 대표 용어들을 선택한 수 예제 문서 내에서의 이들 용어들과 후보 용어들의 발생 빈도의 유사성을 이용하여 가중치를 재산정하고 대표 용어들을 자동 확장하였다. 제안 방법의 성능은 초기 대표 용어들을 선책하는 방법에 의해 영향을 크게 받는다. 따라서 문서집합에서 대표 용어를 추출하는 문제는 불확실성을 내포하고 있으므로 이러한 문제 해결에 효과적인 퍼지 추론을 초기 대표 용어의 선택 방법에 적용하였다. 본 논문에서 다루는 문제는 문서 집합의 중심 벡터를 계산하는 것으로 볼 수가 있다. 성능 평가를 위해 기존의 대표적인 Rocchio 알고리즘과 Widrow-Hoff 알고리즘과의 문서 분류 실험을 하였다. 실험 결과 우수한 성능을 보여줌으로서 제안 방법의 유용성을 확인 할 수 있었다.

  • PDF

의견정보 모니터링을 위한 웹 마이닝 시스템에 관한 연구 (A Study on Web Mining System for Real-Time Monitoring of Opinion Information Based on Web 2.0)

  • 주해종;홍봉화;정복철
    • 한국컴퓨터정보학회논문지
    • /
    • 제15권1호
    • /
    • pp.149-157
    • /
    • 2010
  • 최근에 인터넷 사용이 점차 활발해 짐에 따라, 다른 사람들이 인터넷 상에 올려놓은 의견정보를 참조하고자 하는 수요가 높아지고 있다. 하지만, 이러한인터넷상에존재하는의견들은개개의웹사이트들에만존재하여, 이러한 의견정보들을 사용하고자 할 경우에는 사용자가 일일이 이러한 개개의 모든 웹사이트를 수동으로 찾아보아야 하는 번거로움이 존재하는 문제점이 있다. 본 논문은 웹 콘텐츠에서의 통계기반 웹 마이닝(Web Mining)을 통한 의견 추출 및 분석 시스템에 관한 것으로, 인터넷 상에 존재하는 여러 웹사이트들에 흩어져 있는 웹문서에서 사용자 의견정보들을 자동으로 추출 및 분석한다. 또한, 긍정/부정 의견별로 실시간으로 검색 및 통계를 확인할 수 있는 의견정보 검색 서비스를 간편하게 제공할수 있으며, 의견정보 검색 사용자들은 특정 키워드에 대하여 다른 사용자들의 의견정보를 손쉽게 실시간으로 검색 및 모니터링(Monitoring)할 수 있는 시스템이다. 제안한 기법들은 기존의 다른 기법들과의 비교 실험을 수행하여 실제 성능이 우수함을 증명하였다. 성능 평가는 긍정/부정 의견정보를 추출하는 기능의 성능 평가를 실시하였다. 그 적용 사례로 대표적인 영화 리뷰 문장 실험 데이터를 대상으로 실험하고 그 결과를 분석하였다.

다중 클래스 SVM과 주석 코드 배열을 이용한 의료 영상 자동 주석 생성 (Medical Image Automatic Annotation Using Multi-class SVM and Annotation Code Array)

  • 박기희;고병철;남재열
    • 정보처리학회논문지B
    • /
    • 제16B권4호
    • /
    • pp.281-288
    • /
    • 2009
  • 본 논문은 의료 영상 중 X-ray 영상에 대한 효과적인 분류와 자동 주석 생성을 위한 방법을 제안한다. X-ray 영상은 일반 자연 영상과는 다르게 영상 내에 중요한 의미를 가지고 있는 관심 영역과 어두운 단색의 배경으로 구성된 특징을 가지고 있음으로 본 논문에서는, 영상의 중요영역에서 해리스 코너 검출기를 이용한 색 구조 기술자(H-CSD)로 색 특징을 추출하고, 질감 특징을 위해 경계선 히스토그램 기술자(EHD)를 사용하였다. 추출된 두 개의 특징 벡터들은 각각 다중 클래스 Support Vector Machine에 적용되어 20개의 카테고리 중 하나로 영상을 분류한다. 마지막으로, 영상은 미리 정의된 카테고리들의 계층적인 관계와 우선 순위에 기반하여 주석 코드 배열(Annotation Code Array)을 부여 받고 이를 이용하여 다수의 최적 키워드를 얻으며 갖게 된다. 실험에서는 제안한 주석 생성방법을 관련 연구 방법과 비교하여 성능이 개선 되었음을 보여주고 있다.

한국어 워드넷에서의 개념 유사도를 활용한 선택형 문항 생성 시스템 (A Question Example Generation System for Multiple Choice Tests by utilizing Concept Similarity in Korean WordNet)

  • 김용범;김유섭
    • 정보처리학회논문지A
    • /
    • 제15A권2호
    • /
    • pp.125-134
    • /
    • 2008
  • 본 논문에서는 난이도를 고려하여 선택형 문항을 자동으로 생성하는 방법을 고안하였으며, 학습자 수준에 적합하도록 동적인 형태로 다양한 문항 제시를 할 수 있는 시스템을 구현하였다. 선택형 문제를 통한 평가에서는 적절한 규모의 문제 은행이 필요하다. 이와 같은 요구를 만족시키기 위해서는 보다 쉽고 빠른 방식으로 다양하고 많은 문제 및 문항을 생성할 수 있는 시스템이 필요한데, 본 논문에서는 문제 및 문항의 생성을 위하여 워드넷이라는 언어 자원을 이용한 자동 생성 방법을 고안하였다. 자동 생성을 위해서는 주어진 문장에서 형태소 분석을 통해 키워드를 추출하고, 각 키워드마다 워드넷의 계층적 특성에 따라 유사한 의미를 가진 후보 단어를 제시한다. 의미 유사 후보 단어를 제시할 때, 기존의 한국어 워드넷의 스키마를 개념간 의미 유사도 행렬을 구할 수 있는 형태의 스키마로 변경한다. 단어의 의미 유사도는 동의어를 의미하는 수준 0에서 거의 유사도가 없다고 볼 수 있는 수준 9까지 다양하게 제시될 수 있으며, 생성될 문항에 어느 정도의 유사도를 가진 어휘를 포함시키느냐에 따라서 출제자의 의도에 따른 난이도의 조정이 가능하다. 후보 어휘들의 의미 유사도 측정을 위해서, 본 논문에서는 두 가지 방법을 사용하여 구현하였다. 첫째는 단순히 두 어휘의 워드넷 상에서의 거리만을 고려한 것이고 둘째는 두 어휘가 포함되어 있는 트리 구조의 크기까지 추가적으로 고려한 것이다. 이러한 방법을 통하여 실제 출제자가 기존에 출제된 문제를 토대로 더 다양한 내용과 난이도를 가진 문제 또는 문항을 더 쉽게 출제할 수 있는 시스템을 개발할 수 있었다.

MPEG-7 표준에 따른 내용기반 비디오 검색 시스템 (Content-based Video Indexing and Retrieval System using MPEG-7 Standard)

  • 김형준;김회율
    • 방송공학회논문지
    • /
    • 제9권2호
    • /
    • pp.151-163
    • /
    • 2004
  • 본 논문에서는 비디오의 효율적인 검색과 관리를 위해 MPEG-7 표준에 따른 내용기반 비디오 검색 시스템을 제안한다. 제안된 시스템은 비디오 DB 구축을 위한 인덱싱 모듈과 웹을 통한 비디오 검색 모듈로 구성되며 검색 모듈에서는 다양한 질의 방법을 지원한다. 비디오 인덱싱 모듈은 관리자가 입력한 키워드, 인덱싱 모듈이 자동으로 추출한 등장 인물 정보와 MPEG-7 비주얼 서술자와 같은 메타데이터를 서버에 저장한다. 일반 사용자는 웹을 통해 검색 모듈에 접근하며 키워드, 얼굴 예제 및 스케치 질의와 같은 다양한 질의 방법을 통해 원하는 비디오를 검색할 수 있다. 이러한 비디오 검색 시스템을 구성하기 위해서 본 논문에서는 효율적인 비디오 인덱싱을 위한 장면 전환 검출 방법으로 ATC(Adaptive Twin Comparison)와 사용자 편의성을 위한 개선된 내용기반 질의 방법으로 QBME(Query By Modified Example)를 제안한다. 실험에서 제안된 장면 전환 검출 방법이 기존의 방법보다 우수함을 보였고, 제안된 질의 방법을 통해 기존의 질의 방법인 QBE(Query By Example)나 QBS(Query By Sketch) 보다 사용자에게 검색의 편의성을 제공할 수 있음을 보였다.

AI를 활용한 메타데이터 추출 및 웹서비스용 메타데이터 고도화 연구 (Metadata extraction using AI and advanced metadata research for web services)

  • 박성환
    • 문화기술의 융합
    • /
    • 제10권2호
    • /
    • pp.499-503
    • /
    • 2024
  • 방송 프로그램은 자체 방송 송출 외에도 인터넷 다시 보기, OTT, IPTV 서비스 등 다양한 매체에 제공되고 있다. 이 경우 콘텐츠 특성을 잘 나타내는 검색용 키워드 제공은 필수적이다. 방송사에서는 제작 단계, 아카이브 단계 등에서 주요 키워드를 수동으로 입력하는 방법을 주로 사용한다. 이 방식은 양적으로는 핵심 메타데이터 확보에 부족하고, 내용 면에서도 타 매체 서비스에서 콘텐츠 추천과 검색에 한계를 드러낸다. 본 연구는 EBS에서 개발한 DTV 자막방송 서버를 통해 사전 아카이빙 된 폐쇄형 자막 데이터를 활용하여 다수의 메타데이터를 확보하는 방법을 구현했다. 먼저 구글의 자연어 처리 AI 기술을 적용하여 핵심 메타데이터를 자동으로 추출하였다. 다음 단계는 핵심 연구 내용으로 우선순위와 콘텐츠 특성을 반영하여 핵심 메타데이터를 찾는 방법을 제안한다. 차별화된 메타데이터 가중치를 구하는 기술로는 TF-IDF 계산법을 응용하여 중요도를 분류했다. 실험 결과 성공적인 가중치 데이터를 얻었다. 이 연구로 확보한 문자열 메타데이터는 추후 문자열 유사도 측정 연구와 결합하면 타 매체에 제공하는 콘텐츠 서비스에서 정교한 콘텐츠 추천용 메타데이터를 확보하는 기반이 된다.

인터랙티브 매핑 기법을 활용한 로봇 디자인 트랜드 분석 (Robot Design Trend Analysis using the Interactive Mapping Method)

  • 서종환;변재형;김명석
    • 한국감성과학회:학술대회논문집
    • /
    • 한국감성과학회 2007년도 춘계학술대회 및 국제감성 심포지엄
    • /
    • pp.164-167
    • /
    • 2007
  • 2D 평면상에 이미지를 매핑 하는 것은 디자인 프로세스의 초기에 디자인 트랜드를 이해하는 방법의 하나로써 자주 이용되어 왔다. 이러한 유형의 분석 방법은 로봇 디자인 과정에도 필요하다. 본 연구는 로봇 디자인 분석을 위한 보다 진보된 방법으로써의 인터랙티브 맵의 개발과 활용에 초점을 맞추고 있다. 우선 매핑을 위한 기초 자료로써 로봇 디자인 샘플들을 대상으로 휴리스틱 평가와 사용자 설문조사가 실시하였다. 그 결과는 선형 스케일로 변환되었으며 이를 기초로 매크로미디어사의 플래시를 이용한 인터랙티브 매핑 툴이 개발되었다. 본 연구에서 개발된 인터랙티브 맵은 로봇 디자인의 객관적인 특성을 나타내는 6가지 키워드와 사용자의 유형에 따른 9가지 주관적인 선호도로부터 추출되는 2개의 요소들로 구성되는 105가지 맵을 제시할 수 있다. 디자이너가 2가지 다른 요소들을 자유롭게 선택함에 따라 선택된 2가지 요소를 축으로 하는 이미지 맵이 자동적으로 구성되어 제시된다. 본 연구에서는 이와 같은 인터랙티브 맵을 이용해 실제 사례연구를 진행함으로써 디자이너들이 보다 다양한 발견점과 직관적인 통찰력을 얻을 수 있음을 제시하였다. 이러한 방법은 기존의 전통적인 직접적인 2D 매핑과 비교해서 보다 객관적이고 효율적인 방법으로 생각된다.

  • PDF

URI를 이용한 개체 중심적 통합 검색 시스템 (An Entity-centric Integrated Search System Using URI)

  • 정한민;이미경;성원경
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제35권7호
    • /
    • pp.405-416
    • /
    • 2008
  • 본 연구는 기반 통합 검색의 한계를 극복하고자, 인스턴스를 등록하고 관리하는 URI 서버를 이용하여 개체 페이지를 구성하는 방식의 통합 검색 방안을 제안한다. 키워드로 구성된 사용자 질의어와 매칭된 URI 서버 내의 인스턴스를 분석하여 최적 개체를 선정하고 단위 서비스들을 동시에 호출하는 방식으로 개체 페이지를 구성한다. 또한, 논문으로부터 자동 추출된 주제 정보를 대상으로 추론을 수행함으로써 인물, 기관, 위치 등에 대해서도 주제 중심의 심층적 정보 제공이 가능하다. 해외에서 실 서비스되고 있는 Citeseer, Google Scholar와의 통합 검색 결과 비교 실험과 사용성 평가를 통해 본 연구의 효용성을 실증한다.

귀금속.보석 상품정보 온톨로지 구축에 관한 연구 (A Study on the Development of Ontology based on the Jewelry Brand Information)

  • 이기영
    • 한국컴퓨터정보학회논문지
    • /
    • 제13권7호
    • /
    • pp.247-256
    • /
    • 2008
  • 본 연구에서는 웹 문서에서의 단순 키워드 매칭으로 검색하는 전자상거래시스템의 문제점을 해결하기 위한 방안으로 도메인 온톨로지를 자동으로 생성하고 이를 기반으로 지능형 에이전트기술을 접목함으로서 의사소통이 단일화된 상품검색시스템을 개발한다. 온톨로지 개발은 국제상품분류코드(UNSPSC)와 귀금속 보석 사이트들의 분류정보를 기반으로 대표용어를 추출하고 유사관계 시소러스 적용하여 표준화된 온톨로지를 구축하며 지능형에이전트 기술을 검색 단계에서 접목시켜 사용자에게 정보수집의 효율성을 지원하도록 시맨틱 웹을 지원하는 상거래 시스템을 설계하고 구현한다. 또한 개인화된 검색 환경을 지원하기 위해 사용자 프로파일을 설계하고, 개인화 검색 에이전트와 추론기능을 이용한 검색 환경을 제공함으로서 정보수집의 신속성과 정확한 정보검색이 가능하도록 지원한다.

  • PDF