• 제목/요약/키워드: 이미지/비디오 처리

검색결과 166건 처리시간 0.031초

SIFT 특성 분포를 이용한 비디오 스트림의 장소 변화 예측 (Location Change Estimation in a Video Stream based on SIFT Feature Distributions)

  • 유준희;석호식;장병탁
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2011년도 한국컴퓨터종합학술대회논문집 Vol.38 No.1(C)
    • /
    • pp.295-298
    • /
    • 2011
  • 비디오 데이터의 지능적인 처리를 위해서는 사전에 작성한 메타데이터에 제한 받지 않는 유연한 접근방법이 필요하다. 본 논문에서는 엔트로피를 이용하여 적절한 특징을 추출한 후 비디오를 처리하는 방법을 소개한다. 이미지 인식이 잘 될 경우 일정한 이미지 조합으로 비디오의 배경을 설명할 수 있지만, 이미지 인식이 어렵기 때문에 동일한 배경일지라도 등장 인물의 움직임, 촬영 각도의 변화 등 사소한 변화가 발생하면 컴퓨터는 다른 이미지인 것으로 간주하게 된다. 우리가 제안하는 방법은 비디오를 구성하는 이미지 프레임에서 추출한 SIFT(Scale Invariant Feature Transform) 특성의 분포를 엔트로피에 기반하여 재구성한 후 분포 변화를 통해 장소 변화를 추정하는 방법이다. 제안 방법은 비디오 데이터의 이미지를 특징 짓는 비주얼 워드의 분포를 활용하기 때문에 사소한 변화 정도의 영향을 받지 않으면서 동시에 배경의 확연한 변화를 나타낼 수 있다. 우리는 실제 TV 드라마 데이터에 적용하여 제안 방법의 유용성을 확인하였다.

해안 디지털 비디오를 이용한 쇄파지역에서의 파랑궤적 측정 (Remote Sensing of Wave Trajectory in Surf Zone using Oblique Digital Videos)

  • 유제선;신동민;조용식
    • 한국해안·해양공학회논문집
    • /
    • 제20권4호
    • /
    • pp.333-341
    • /
    • 2008
  • 본 연구에서는 해안 디지털 비디오를 이용하여 쇄파지역에서의 파랑궤적을 원격으로 측정하는 기술을 제안한다. 쇄파에 의해 발생하는 거품은 비디오 이미지로부터 파랑속성을 측정하는데 큰 오차를 야기한다. 이러한 이유로, 본 연구는 이미지 상에서 파랑신호와는 다른 거품 노이즈를 제거하기 위한 고급 영상처리기술과 쇄파지역에서 파랑속성을 효과적으로 측정하는데 필요한 파랑궤적을 검출하는 방법에 초점을 두고 있다. 이를 위하여 본 연구는 100 m 이상 거리범위의 쇄파지역에서 3 Hz 주파수로 촬영한 해안 비디오 자료를 이용한다. 비디오 원 영상으로부터 고주파수의 특성을 가지는 거품신호를 제거하기 위하여 이미지 프레임 후방차분과 방향성 로패스 이미지 필터를 통하여 비디오 이미지를 영상처리한다. 개별의 쇄파 파랑궤적은 레이돈 변환 선인식 알고리듬을 이용하여, 거품 노이즈가 제거된 해안선 수직방향 이미지 Timestack상에 적용하여 검출된다. 이 이미지 Timestack의 물리적 공간차원은 2차원 공간-시간 도메인으로 표현된다. 비디오 자료로부터 측정된 유효 파랑궤적의 개수는 실측자료로부터 얻어진 파랑개수의 약 2/3이다.

이미지-텍스트 자질을 이용한 행동 포착 비디오 기반 대화시스템 (Audio-Visual Scene Aware Dialogue System Utilizing Action From Vision and Language Features)

  • 임정우;장윤나;손준영;이승윤;박기남;임희석
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2023년도 제35회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.253-257
    • /
    • 2023
  • 최근 다양한 대화 시스템이 스마트폰 어시스턴트, 자동 차 내비게이션, 음성 제어 스피커, 인간 중심 로봇 등의 실세계 인간-기계 인터페이스에 적용되고 있다. 하지만 대부분의 대화 시스템은 텍스트 기반으로 작동해 다중 모달리티 입력을 처리할 수 없다. 이 문제를 해결하기 위해서는 비디오와 같은 다중 모달리티 장면 인식을 통합한 대화 시스템이 필요하다. 기존의 비디오 기반 대화 시스템은 주로 시각, 이미지, 오디오 등의 다양한 자질을 합성하거나 사전 학습을 통해 이미지와 텍스트를 잘 정렬하는 데에만 집중하여 중요한 행동 단서와 소리 단서를 놓치고 있다는 한계가 존재한다. 본 논문은 이미지-텍스트 정렬의 사전학습 임베딩과 행동 단서, 소리 단서를 활용해 비디오 기반 대화 시스템을 개선한다. 제안한 모델은 텍스트와 이미지, 그리고 오디오 임베딩을 인코딩하고, 이를 바탕으로 관련 프레임과 행동 단서를 추출하여 발화를 생성하는 과정을 거친다. AVSD 데이터셋에서의 실험 결과, 제안한 모델이 기존의 모델보다 높은 성능을 보였으며, 대표적인 이미지-텍스트 자질들을 비디오 기반 대화시스템에서 비교 분석하였다.

  • PDF

안드로이드 모바일 플랫폼에서 이미지 태그 추천을 위한 시스템 구현 (Implementation of a System for Image Tag Recommendation Using an Android Mobile Platform)

  • 엄원용;민현석;이시형;;노용만
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2010년도 추계학술발표대회
    • /
    • pp.609-612
    • /
    • 2010
  • 최근 스마트 폰을 이용한 사용자들이 생성하는 사진 데이터의 양이 급속히 증가하였다. 폭발적인 사진 데이터 양의 증가는 사용자가 원하는 사진에 대한 접근을 어렵게 하였다. 때문에 본 연구에서는 사진의 접근 및 관리의 효율을 높이기 위한 폭소노미를 통한 태그 추천 시스템을 안드로이드 모바일 플랫폼과 서버의 연계로 구현하였다. 구현된 애플리케이션은 25,000 장의 사진을 기반으로 하는 폭소노미를 통해 태그 추천을 하며, 태그 추천에 평균적으로 5.5 초의 시간이 걸렸다.

인덱싱 에이전트를 이용한 멀티미디어 데이터 검색시스템 (A Multimedia Data Search System using Indexing Agent)

  • 고재운
    • 한국산학기술학회:학술대회논문집
    • /
    • 한국산학기술학회 2010년도 춘계학술발표논문집 1부
    • /
    • pp.487-490
    • /
    • 2010
  • 비디오 데이터를 효율적으로 처리하기 위해서는 비디오 데이터가 가지고 있는 내용에 대한 정보를 데이터베이스에 저장하고 사용자들의 다양한 질의를 처리할 수 있는 의미기반 검색 기법이 요구된다. 기존의 내용기반 비디오 검색 시스템들은 주석기반 검색 또는 특징기반 검색과 같은 단일 방식으로만 검색을 하므로 검색 효율이 낮을 뿐 아니라 완전한 자동 처리가 되지 않아 시스템 관리자나 주석자의 많은 노력을 요구한다. 본 논문에서는 주석기반 검색과 특징기반 검색을 이용하여 대용량의 비디오 데이터에 대한 사용자의 다양한 의미검색을 지원하는 에이전트 기반에서의 자동화되고 통합된 비디오 의미기반 검색 시스템을 제안한다. 사용자의 기본적인 질의와 질의에 의해 추출된 키 프레임의 이미지를 선택함으로써 에이전트는 추출된 키 프레임의 주석에 대한 의미를 더욱 구체화시킨다. 또한, 사용자에 의해 선택된 키 프레임은 질의 이미지가 되어 제안하는 특징기반 검색기법을 통해 가장 유사한 키 프레임을 검색한다. 따라서 의미기반 검색을 통해 비디오 데이터의 검색의 효율을 높일 수 있도록 시스템을 설계한다.

  • PDF

효율적인 비디오 브라우징 및 검색을 위한 통합 멀티미디어 응용 형식 (Integrated Multimedia Application Format for Active Video Browsing and Retrieval)

  • 조준호;진성호;양승지;노용만
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2005년도 추계학술발표대회 및 정기총회
    • /
    • pp.155-158
    • /
    • 2005
  • 본 논문에서는 MPEG 의 멀티미디어 응용 표준인 MAF(Multimedia Application Format)를 기반으로, 효율적인 비디오 콘텐츠의 검색 및 활용을 위한 통합 미디어 구조, 즉 비디오 MAF 를 제안한다. 제안하는 비디오 MAF 는 ISO 미디어 포맷을 기반으로 하고 단일의 비주얼 스트림과 다중 음성을 지원하기 위한 다수의 오디오 스트림, 내용기반의 정보를 포함하는 메타데이터, 그리고 비디오 콘텐츠의 대표 이미지를 동시에 포함하는 구조이다. 제안하는 파일포맷의 유용성을 검증하기 위해 비디오 MAF 로 생성 및 해석할 수 있는 부호기(encoder)와 복호기(decoder)를 설계하고 구현하여, 통합 미디어에 내재된 메타데이터를 이용한 효율적인 검색과 멀티트랙의 오디오 스트림을 활용한 다중 음성에 대한 지원이 가능함을 확인하였다. 또한 내재된 대표이미지는 비디오 콘텐츠에 대한 브라우징이 효과적으로 활용됨을 확인하였다.

  • PDF

인덱싱 에이전트를 이용한 멀티미디어 데이터베이스 시스템 (A Multimedia Database System using Indexing Agent)

  • 이광형;이창수;이종희;오해석
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2003년도 추계학술발표논문집 (상)
    • /
    • pp.57-60
    • /
    • 2003
  • 비디오 데이터를 효율적으로 처리하기 위해서는 비디오 데이터가 가지고 있는 내용에 대한 정보를 데이터베이스에 저장하고 사용자들의 다양한 질의를 처리할 수 있는 의미기반 검색 기법이 요구된다. 기존의 내용기반 비디오 검색 시스템들은 주석기반 검색 또는 특징기반 검색과 같은 단일 방식으로만 검색을 하므로 검색 효율이 낮을 뿐 아니라 완전한 자동 처리가 되지 않아 시스템 관리자나 주석자의 많은 노력을 요구한다. 본 논문에서는 주석기반 검색과 특징기반 검색을 이용하여 대용량의 비디오 데이터에 대한 사용자의 다양한 의미검색을 지원하는 에이전트 기반에서의 자동화되고 통합된 비디오 의미기반 검색 시스템을 제안한다. 사용자의 기본적인 질의와 질의에 의해 추출된 키 프레임의 이미지를 선택함으로써 에이전트는 추출된 키 프레임의 주석에 대한 의미를 더욱 구체화시킨다. 또한, 사용자에 의해 선택된 키 프레임은 질의 이미지가 되어 제안하는 특징기반 검색기법을 통해 가장 유사한 키 프레임을 검색한다. 따라서 의미기반 검색을 통해 비디오 데이터의 검색의 효율을 높일 수 있도록 시스템은 설계한다.

  • PDF

폭소노미에서 이미지 자동 태깅을 위한 사회적 관계 추출에 관한 연구 (Study for social relationship extraction for automatically image tagging in Folksonomy)

  • 엄원용;이시형;노용만
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2010년도 춘계학술발표대회
    • /
    • pp.425-428
    • /
    • 2010
  • 멀티미디어 기기의 확산과 인터넷의 발달로 Flickr, Facebook 과 같은 사회적 네트워크를 기반으로 이미지 공유가 활발해졌다. 사회적 네트워크 사이트에서 이미지의 효율적인 검색과 관리를 위해서 태그를 이용하는 방법이 많이 사용되고 있다. 하지만 많은 양의 이미지에 수동으로 태그를 등록하는 것은 사용자에게 많은 시간과 노력을 요구한다. 태그 추천 기술은 자동으로 사용자에게 태그를 추천함으로써, 수동 태깅의 한계를 극복할 수 있는 방법이다. 본 논문에서는 사회적 네트워크를 기반으로 하는 폭소노미에서 사용자 사이의 사회적 관계를 사용자 들의 얼굴 정보를 이용하여 측정하고, 이를 활용하여 이미지 태그를 추천하는 기술을 제안한다. 제안하는 방법은 이미지의 시각 정보와 태그 분포뿐만 아니라 사용자 사이의 사회적 관계 정보를 추가로 활용한다. 실험을 통해서 제안하는 방법이 기존의 이미지 태그 추천 방법에 비해서 7% 향상된 태그 추천의 정확성을 보장하는 것을 증명하였다.

XML 기반 비디오 데이터의 메타데이터 설계 (Meta Data Design for Video Data based on XML)

  • 고은경;황부현
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2003년도 춘계학술발표논문집 (하)
    • /
    • pp.1659-1662
    • /
    • 2003
  • 웹 환경에서 사용되고 있는 데이터의 종류는 텍스트뿐만 아니라 멀티미디어 데이터까지 다양하게 사용되어 지고 있다. 그러나 오디오, 이미지, 비디오와 같은 미디어 객체들은 2진화, 비구조화 되어 있으므로 기계 번역이 용이하지 않다. 이런 비정형화 된 비디오 데이터에 대한 검색을 효율적으로 처리하기 위해서는 비디오의 논리적 구조와 의미적 내용을 표현할 수 있어야 한다. 멀티미디어 데이터의 메타 데이터를 표현하기 위해서 XML 문서를 이용하여 표현하고, 표현된 문서를 효율적으로 검색 할 수 있도록 설계하였다.

  • PDF

효율적인 비디오 카투닝을 위한 인터랙티브 시스템 (Interactive System for Efficient Video Cartooning)

  • 홍성수;윤종철;이인권
    • 한국HCI학회:학술대회논문집
    • /
    • 한국HCI학회 2006년도 학술대회 1부
    • /
    • pp.859-864
    • /
    • 2006
  • Mean shift 는 데이터의 특징을 잘 살려내는 None-parametric 방법으로, 특히 영상처리분야에서 많은 각광을 받아왔다. 하지만 좋은 결과를 보장하는 뛰어난 성능에도 불구하고, 높은 메모리소요와 긴 처리시간에 기인하여, 비디오처리 등의 분야에 적용하기엔 현실적인 제약점이 있다. 상기한 제약점을 극복하기 위해, 본 시스템은 비디오를 분석하여 전경과 후경으로 나눈다. 본 논문은 전경으로 분류된 부분에 대해 각 분리된 개체를구분하고, 좌표변환(coordinate shift)을 실행하여 연산을 할 비디오의 연산의 규모를 줄이는 방법론을 제시한다. 이러한 처리로 매우 많은 처리시간이 단축됨을 실험을 통해 알 수 있었다. 다음으로, 나뉘어진 전경에 3D mean shift를 적용하여 생성된 결과물에 대하여 3D cluster data structure 를 생성하고, 이를 이동하여 인터랙티브 에디팅이 가능하도록 하였다. 후경으로 나뉜 데이터는 이미지 한 장으로 축약이 되며, 2D mean shift 기반의 interactive cartooning system 을 통하여 만화화가 된다. 본 논문은 만화 특유의 단순한 톤을 표현하기 위해, 세밀한 분할이 필요한 부분과 그렇지 않은 부분을 따로 구분하여 처리하는 레이어처리방법을 제안한다. 위의 과정을 여러 실사이미지에 적용, 실험해본 결과 기존의 연구결과에 비해 매우 짧은 시간 내에 대상의 특징이 잘 나타낸 양질의 결과물이 생성되었다. 이러한 결과물은 출판, 영상편집분야 등 여러 분야에서 요긴하고 간편하게 사용될 수 있을 것으로 생각된다.

  • PDF