Abstract
Recently, a number of researches related to video annotation and representation have been proposed to analyze video for searching and abstraction. In this paper, we have presented a method to provide the picture elements of conversational participants in video and the enhanced representation of the characters using those elements, collectively called Character-net. Because conversational participants are decided as characters detected in a script holding time, the previous Character-net suffers serious limitation that some listeners could not be detected as the participants. The participants who complete the story in video are very important factor to understand the context of the conversation. The picture elements for detecting the conversational participants consist of six elements as follows: subtitle, scene, the order of appearance, characters' eyes, patterns, and lip motion. In this paper, we present how to use those elements for detecting conversational participants and how to improve the representation of the Character-net. We can detect the conversational participants accurately when the proposed elements combine together and satisfy the special conditions. The experimental evaluation shows that the proposed method brings significant advantages in terms of both improving the detection of the conversational participants and enhancing the representation of Character-net.
동영상 검색이나 축약과 같은 동영상 분석을 위해 동영상 어노테이션 기술이나 동영상 정보 표현에 대한 다양한 연구가 있어왔다. 이를 위해 본 논문은 대화 참여자 결점을 위한 영상적 요소와 이러한 요소를 이용하여 Character-net 표현을 개선하는 방법을 제안한다. 기존 Character-net이 자막이 뜨는 시간에 나타나는 등장인물들만을 대화참여자로 고려하므로 일부의 청자를 제외시키는 문제점이 있다. 대화 참여자는 대화상황 파악의 극히 중요한 요소로 동영상 검색 시에 기준이 될 수 있으며 동영상의 이야기 전개를 이끌어 나간다. 대화 참여자를 결정하기 위한 영상적 요소에는 자막의 유무, 장면, 인물 등장순서, 시선방향, 패턴, 입의 움직임 등이 있다. 본 논문에서는 이러한 영상적 요소에 근거하여 대화 참여자를 판단하고 동영상 표현방법인 Character-net을 개선하고자 한다. 제안한 여러 요소들이 결합되고 일정한 조건이 만족되었을 때 대화참여자를 정확히 검출할 수 있다. 따라서 본 논문에서는 대화참여자를 결정하기 위한 영상적 요소들을 제안하고 이를 통해 Character-net의 표현성능을 개선하고 실험을 통하여 제안된 방법론이 대화 참여자 판단의 정확성과 Character-net의 표현성능을 제고함을 증명하였다.