• Title/Summary/Keyword: hyperlink

Search Result 92, Processing Time 0.262 seconds

KorBERT와 Popularity 정보에 기반한 한국어 개체연결 (Korean Entity Linking based on KorBERT and Popularity )

  • 허정;배경만;임수종
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2022년도 제34회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.502-506
    • /
    • 2022
  • 본 논문에서는 KorBERT와 개체 인기정보(popularity)를 이용한 개체연결 기술을 소개한다. 멘션인식(mention detection)은 KorBERT를 이용한 토큰분류 문제로 학습하여 모델을 구성하였고, 개체 모호성해소(entity disambiguation)는 멘션 컨텍스트와 개체후보 컨텍스트 간의 의미적 연관성에 대한 KorBERT기반 이진분류 문제로 학습하여 모델을 구성하였다. 개체 인기정보는 위키피디아의 hyperlink, inlink, length 정보를 활용하였다. 멘션인식은 ETRI 개체명 인식기를 이용한 모델과 비교하였을 경우, ETRI 평가데이터에서는 F1 0.0312, 국립국어원 평가데이터에서는 F1 0.1106의 성능 개선이 있었다. 개체 모호성해소는 KorBERT 모델과 Popularity 모델을 혼용한 모델(hybrid)에서 가장 우수한 성능을 보였다. ETRI 평가데이터에서는 Hybrid 모델에서의 개체 모호성 해소의 성능이 Acc. 0.8911 이고, 국립국어원 평가데이터에서는 Acc. 0.793 이였다. 최종적으로 멘션인식 모델과 개체 모호성해소 모델을 통합한 개체연결 성능은 ETRI 평가데이터에서는 F1 0.7617 이고, 국립국어원 평가데이터에서는 F1 0.6784 였다.

  • PDF

Sorting Instagram Hashtags all the Way throw Mass Tagging using HITS Algorithm

  • D.Vishnu Vardhan;Dr.CH.Aparna
    • International Journal of Computer Science & Network Security
    • /
    • 제23권11호
    • /
    • pp.93-98
    • /
    • 2023
  • Instagram is one of the fastest-growing online photo social web services where users share their life images and videos with other users. Image tagging is an essential step for developing Automatic Image Annotation (AIA) methods that are based on the learning by example paradigm. Hashtags can be used on just about any social media platform, but they're most popular on Twitter and Instagram. Using hashtags is essentially a way to group together conversations or content around a certain topic, making it easy for people to find content that interests them. Practically on average, 20% of the Instagram hashtags are related to the actual visual content of the image they accompany, i.e., they are descriptive hashtags, while there are many irrelevant hashtags, i.e., stophashtags, that are used across totally different images just for gathering clicks and for search ability enhancement. Hence in this work, Sorting instagram hashtags all the way through mass tagging using HITS (Hyperlink-Induced Topic Search) algorithm is presented. The hashtags can sorted to several groups according to Jensen-Shannon divergence between any two hashtags. This approach provides an effective and consistent way for finding pairs of Instagram images and hashtags, which lead to representative and noise-free training sets for content-based image retrieval. The HITS algorithm is first used to rank the annotators in terms of their effectiveness in the crowd tagging task and then to identify the right hashtags per image.

사회과 지역교과서 활용을 위한 전자교과서의 설계 및 구현 (Design and Implementation of Electronic Text Books in order to Utilize Regional Text Books for Social Studies)

  • 강오한;박희성
    • 컴퓨터교육학회논문지
    • /
    • 제9권1호
    • /
    • pp.19-28
    • /
    • 2006
  • 본 논문에서는 초등학교에서 교재로 사용할 수 있도록 교육과정의 내용을 중심으로 사회과 전자 교과서를 설계하고 구현하였다. 또한 구현한 전자교과서에 대한 교사들의 인식 수준을 사이트의 접근 및 활용성, 교수학습의 설계, 수업 운영, 학습 내용의 타당성 및 정확성, 인터페이스 설계, 웹 멀티미디어에 관한 측면에서 설문을 조사하고 결과를 분석하였다. 본 논문에서는 전자교과서 개발을 위한 새로운 모형을 제시하였으며, 이 모형은 기존의 모형에 비해 주 교재로 사용하기 위한 전자교과서 개발에 유용할 것으로 기대된다. 사용자 인터페이스는 책 메타포를 활용한 네비게이션을 적용하였으며, 온라인의 장점을 살린 외부 사이트 연결이나 외부 프로그램과의 연결 외에도 풍부한 멀티미디어 자료를 제공하였다. 실험 결과 학습자의 학업성취도 측면에서 지식 이해 영역과 기능 영역에서 학습자의 학업성취도가 높게 나타났다.

  • PDF

웹 로봇 에이전트의 하이퍼링크 분석기법을 이용한 음란메일 차단 시스템의 구현 (Implementation of Anti-Porn Spam System based on Hyperlink Analysis Technique's of the Web Robot Agent)

  • 이승만;정희석;한상;송우석;이도한;홍지영;반의환;양준영
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2007년도 한국컴퓨터종합학술대회논문집 Vol.34 No.1 (C)
    • /
    • pp.332-335
    • /
    • 2007
  • 이메일은 누구나 쉽게 정보를 교환할 수 있는 편리함 때문에 인터넷에서 가장 중요한 수단으로 사용되고 있다. 그러나 순수한 의사소통의 수단이 아닌 스팸메일의 범람은 성인뿐만 아니라, 어린이 청소년에게도 무차별적으로 전송됨으로써 심각한 부작용을 낳고 있다. 본 논문은 점차 지능화 되는 신 유형의 음란 스팸메일로부터 청소년을 보호하기 위하여 새로운 방법의 음란메일 차단시스템을 제안하고자 한다. 기존의 스팸메일 차단시스템은 사용자가 직접 음란한 메일이라고 판단되는 메일에 대해 일일이 키워드를 설정하거나, 메일 내용 중에 텍스트만을 추출하여 패턴 매칭방법으로 분류하는 것이 대부분이었지만, 본 논문은 기존 방법의 문제점을 해결하기 위하여 이미지 내 Skin-Color분포의 Human Detection 알고리즘과 웹 로봇 에이전트의 하이퍼링크 분석기법을 사용하였다. 성능 측정결과, 형태소 분석과 Human Detection 알고리즘을 병합하여 적용한 경우 성능 측정에서 90% 정도의 F-measure를 보였지만, 추가적으로 웹 로봇 에이전트의 하이퍼링크 분석기법을 병합하여 적용한 경우 97% 이상의 F-measure를 보이며, 신뢰성이 높은 음란스팸메일 차단 시스템을 구현할 수 있다는 것을 증명하였다.

  • PDF

사용자 적합성 피드백과 구루 평가 점수를 고려한 블로그 검색 방법 (Blog Search Method using User Relevance Feedback and Guru Estimation)

  • 정경석;박혁로
    • 정보처리학회논문지B
    • /
    • 제15B권5호
    • /
    • pp.487-492
    • /
    • 2008
  • 대부분의 웹 검색엔진은 문서의 적합도와 중요도를 함께 고려하는 순위화 방법을 사용한다. 문서의 적합도는 문서가 사용자의 검색의도를 만족시키는 정도이고, 중요도는 인기 있거나 양질의 내용을 포함하는 등 문서의 품질을 표시하는 정도라고 할 수 있다. 지금까지 웹 문서의 중요도를 평가하는 방법으로 가장 성공적인 것은 하이퍼링크 구조를 사용한 방법이다. 하지만 블로그의 경우, 해당 블로그를 작성한 블로거와 그 블로거가 소유하는 다른 문서들을 알 수 있기 때문에 문서의 중요도를 평가하는 다른 방법을 생각할 수 있다. 본 논문에서 제안하는 방법은 사용자의 북마크와 클릭를 이용하여 문서의 중요도를 계산하고, 그러한 문서 점수를 바탕으로 블로거의 구루점수를 계산한다. 마지막으로 문서를 순위화할 때 해당 문서를 작성한 구루의 구루 점수를 반영한다. 이렇게 되면 구루점수가 높은 구루 블로거의 문서들이 상위에 검색됨에 따라서 전반적으로 검색 품질이 개선될 수 있다. 블로그 문서를 대상으로 한 실험결과 제안하는 방법이 기존의 전통적인 웹 검색 성능과 비교하여 정답집합과의 연관성이 높음을 알 수 있었다.

웹 접근성 향상을 위한 웹 서핑 도우미 (A Web Surfing Assistant for Improved Web Accessibility)

  • 이수철;이시은;황인준
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제31권9호
    • /
    • pp.1180-1195
    • /
    • 2004
  • 정보의 급격한 증가로 인하여 웹에서 원하는 정보와 서비스를 찾고 이용하는 데 더 많은 시간이 소요되고 있다. 웹 상의 정보는 하이퍼링크(Hyperlink)를 통하여 여러 웹페이지에 걸쳐 표현되고 있으며 하나의 웹페이지는 여러 주제의 정보를 포함하고 있다. 그러나 대부분의 웹 탐색 도구들은 이러한 웹 저작경향을 반영하지 않고, 웹페이지를 독립적인 정보의 단위로 다루고 있다. 이러한 차이로 인해 사용자 는 정보를 검색하고 브라우징하는 데 어려움을 겪는다. 본 논문에서는 웹 정보에 대한 접근성 향상을 위해 테이블 구조를 가지고 있는 여러 웹페이지에 흩어져있는 정보들을 모아 하나의 컬렉션페이지 (collection page)에 새롭게 구성하여 제공하는 LinkBroker 시스템을 제안한다. 본 시스템은 논리적으로 연결된 정보를 담은 페이지들을 추출한 뒤 페이지셋으로 묶어 검색과 북마크의 단위로 다룬다. 그리고 페이지셋에 속한 페이지 내의 주요 컨텐츠 구역들을 이용해 컬렉션페이지를 생성함으로써 흩어져있는 정보를 하나의 페이지에 표현한다. 다양한 검색 목적에 부합되는 실험을 통해 페이지셋 단위의 검색과 북마크의 효율성 그리고 컬렉션페이지를 통한 정보 접근성의 향상을 확인할 수 있다.

학술지 인용과 웹 링크 분석을 통한 과학기술분야의 학제성 비교 연구 (A Comparative Study on Interdisciplinarity in the Fields of Science and Technology Based on Journal Citation and Web Link Analyses)

  • 정호연;정영미
    • 정보관리학회지
    • /
    • 제24권3호
    • /
    • pp.179-200
    • /
    • 2007
  • 이 논문에서는 학술지 인용 데이터와 웹 링크 데이터를 이용하여 8개 과학기술 분야의 학제적 구조를 파악하고 각 학문분야 간 학제성을 비교하였다. 분석 대상이 되는 학술지와 웹 페이지의 주제적 성격을 파악하기 위해 기존의 과학기술분류체계를 재구성하여 이용하였다. 이 연구에서 학제성은 여러 학문분야간 학제적 연결의 측면에서 파악하였으며, 학제성의 정도는 연관 학문분야의 수로 측정한 학제적 다양성과 자기인용률에 의해 평가하였다. 분석 결과, 학술지 인용 분석에서는 밝혀내지 못한 새로운 학제적 연결을 웹 링크분석에 의해 파악하였으며, 이를 통해 웹 링크 분석이 학제성을 연구하는 수단으로서 유용함을 알 수 있었다. 또한 인용 분석과 링크 분석에서 모두 자연과학 분야에 비해 공학 분야의 학제성이 대체로 더 높게 나타났다.

웹 사이트 구조를 이용한 토픽 검색 연구 (An Experimental Study on Topic Distillation Using Web Site Structure)

  • 이지숙;정영미
    • 정보관리학회지
    • /
    • 제24권3호
    • /
    • pp.201-218
    • /
    • 2007
  • 이 연구에서는 TRBC이 제시한 토픽 검색의 정의에 따라 질의에 적합한 웹 사이트를 검색하는 효과적인 토픽 검색 알고리즘을 제안하고 실험을 통해 그 성능을 평가하였다. 이 연구의 토픽 검색 알고리즘은 먼저 질의에 대한 웹 페이지 검색 결과로부터 적합한 웹 사이트를 선정한 다음, 선정된 사이트의 구조를 이용하여 질의에 대한 적합성 점수를 산출한다. TREC의 .GOV 실험 문헌 집단과 TREC-2004 실험의 질의 및 적합문헌 리스트를 이용한 검색 실험 결과 이 토픽 검색 알고리즘은 상위 10위 안에 최소 2개 이상의 적합 사이트를 검색하여 비교적 높은 수준의 성능을 보였다. 또한 TREC-2004의 적합문헌 리스트 분석을 통해 적합문헌 선정에 토픽 검색의 정의가 엄격하게 적용되지 않은 경우가 있음을 확인하고, 수정된 적합문헌 리스트를 이용하여 토픽 검색 성능을 재평가한 결과 이 연구에서 제안한 토픽 검색 알고리즘의 성능이 월등히 향상되었다.

C-rank: 웹 페이지 랭킹을 위한 기여도 기반 접근법 (C-rank: A Contribution-Based Approach for Web Page Ranking)

  • 이상철;김동진;손호용;김상욱;이재범
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제16권1호
    • /
    • pp.100-104
    • /
    • 2010
  • 수많은 웹 문서로부터 웹 서퍼가 원하는 정보를 찾기 위해 다양한 검색 엔진들이 개발되어왔다. 검색 엔진에서 가장 중요한 기능 중 하나는 사용자 질의에 대해서 웹 문서를 평가하고 랭킹을 부여하는 것이다. PageRank등의 기존 하이퍼링크 정보를 이용한 웹 랭킹 알고리즘은 토픽 드리프트 현상을 발생시킨다. 이러한 문제를 해결하기 위하여 연관성 파급 모델이 제안되었지만, 기존의 연관성 파급 모델을 기반으로 하는 랭킹 알고리즘은 성능상의 이유로 실제 웹 검색 엔진에서 사용하기 어렵다. 본 논문에서는 이러한 토픽 드리프트 현상을 완화하면서 좋은 성능을 제공하는 새로운 랭킹 알고리즘을 제안한다. 다양한 실험을 통하여 기존 알고리즘들과 비교한 제안하는 알고리즘의 우수성을 검증한다.

공간메타포 개념을 이용한 웹 사이트 네비게이션의 사용성 평가 (Usability Test of Website Navigation by Using Spatial Metaphor Concept)

  • 이건창;정남호;홍노경
    • 지능정보연구
    • /
    • 제10권1호
    • /
    • pp.93-107
    • /
    • 2004
  • 급속한 인터넷의 확산으로 이제 웹은 단지 커뮤니케이션이나 홍보, 쇼핑의 수단뿐이 아닌 정보의 보급 및 창고로서의 역할이 더욱 커지고 있다. 또한, 과거의 웹 기반 기술인 하이퍼텍스트에 멀티미디어 기술이 접목되면서 하이퍼미디어 개념이 도입되어 텍스트 외의 이미지, 동영상, 사운드 등 다양한 형식의 미디어를 통해 정보를 접할 수 있게 되었다. 그러나, 이러한 정보공간에서 정보의 양이 기하급수적으로 증가함에 따라 웹 이용자들은 인지과부하(Cognitive overload)로 인하여 웹 상에서 방향감 상실, 정보공간에서 길 잃음 둥의 다양한 어려움을 겪고 있다. 이러한 문제를 해결하기 위해 많은 연구자들이 지속적으로 연구하고 있으며 그 중의 하나가 공간 개념(Spatial concept)을 적용한 공간 메타포(Spatial metaphor) 연구이다. 본 연구에서는 이러한 공간 메타포 개념을 이용하여 새로운 개념의 네비게이션 방식의 웹사이트를 개발하고 이를 Atomic-Map이라고 하였다. Davis 교수가 제안한 기술수용모형 (TAM) 모형을 이용하여 Atomic-Map의 사용성을 분석한 결과 Atomic-Map을 이용하여 정보공간에서 복잡한 네비게이션 하에서 발생할 수 있는 여러 가지 문제를 해결할 수 있음을 실증적으로 검증하였다.

  • PDF