본 연구는 질의어 확장 및 단기 이용자 모형 구축에 응용할 수 있는 하나의 기법으로서 이용자 질문구조의 전형을 통한 정보요구의 모형화를 실험을 통해 제시한다. 실험방법은 이용자의 질문을 시소러스를 통해 분석, 구조화 하고 그 질문구조에서 전형을 추출한 후 전형에 따라 요구하는 정보가 질문구조내에 일정하게 위치하는지를 알아보았다. 이러한 실험을 통해 6가지 질문구조 전형을 추출할 수 있었으며 질문구조의 전형을 이용한 정보요구 모형의 구축이 타당성이 있음을 입증하였고 지능형 정보검색 시스템에의 적용가능성을 논의하였다.
질문 생성이란 구절이 입력되면 구절에서 답을 찾을 수 있는 질문을 자동으로 생성하는 작업으로 교육용 시스템, 대화 시스템, QA 시스템 등 다양한 분야에서 중요한 역할을 한다. 질문 생성에서 정답의 단어가 질문에 포함되는 문제점을 해결하기 위해 구절과 정답을 분리한다. 하지만 구절과 정답을 분리하게 되면 구절에서 정답의 정보가 손실되고, 정답에서는 구절의 문맥 정보가 손실되어 정답 유형에 맞는 질문을 생성할 수 없는 문제가 발생된다. 본 논문은 이러한 문제를 해결하기 위해 분리된 정답과 구절의 정보를 연결시켜주는 정답과 구절의 공동 주의 집중 계층을 제안한다. 23,658개의 질문-응답 쌍의 말뭉치를 이용한 실험에서 정답과 구절의 공동 주의 집중 계층이 성능 향상에 기여해 우수한 성능(BLEU-26.7, ROUGE-57.5)을 보였다.
본 연구는 덕성여자대학교 도서관을 중심으로 도서관내에서 제기되는 이용자의 참고질문을 분석함으로써 대학도서관 이용자들의 잠재적 정보요구를 파악하고자 하였다. 2000년 10월 10일부터 12월 13일 까지 64일 동안 대학도서관내에서 제기되는 참고질문 총 474건을 수집 분석하였다. 사서의 전문적 지식이 요구되는 순수한 참고질문은 총 474건의 질문의 10.1%인 48건에 불과하여 대학도서관의 양질의 참고정보서비스 제공은 매우 소극적 수준인 것으로 나타났다. 특정 도서나 장소의 위치를 묻는 방향적 질문이 139건(29.3%), 기기관련 질문이 113건(23.8%), 도서관 정책관련 질문이 85건(17.9%)등, 세 종류의 질문이 총 질문의 71.0%안 337건을 차지하여 이용자는 도서관 사용에 필수적인 기초적인 안내정보를 필요로하는 것으로 나타났다. 도서관은 적어도 사인(sign)시스템과 안내정보시스템을 개선함으로써 방향적 질문(29.3%)과 도서관정책관련 질문(17.9%)을 포함한 이용자의 정보요구의 47.2%룰 만족시킬 수 있을 것으로 예측된다.
국내 인터넷 검색엔진의 성능을 질문의 유형별로 비교해보았다. 실험에는 30명의 대학생이 참여하여 탐색질문을 작성하고 직접 탐색하여 검색결과의 적합성을 판정하였다. 실험참가자마다 탐색어 1개, 2개, 3개짜리 질문을 하나씩 작성하도록 한 결과 총 90개의 질문이 실험에 사용되었다. 질문의 유형은 질문의 길이 이외에 주제의 최신성 여부와 고유명사의 포함 여부를 기준으로 나누었다. 실험 결과 전체적인 성능은 구글이 가장 뛰어났으나, 고유명사를 포함한 최신주제 질문에 대해서는 네이트와 엠파스가 구글보다 좋은 성능을 보였다.
본 연구에서는 인터넷을 통하여 질문지를 배포하고 회수하는 실험을 한 결과 현시점에서는 사이버 공간에서 게시판에 질문지를 올리는 것은 거의 불가능하고, 질문지를 배포하는데는 사서나 아르바이트 학생 등 다른 사람들의 적극적인 도움이 필요할 뿐만 아니라 질문지 회수율이 매우 낮았다. 전자우편으로 질문지를 회수하더라도 일단 프린트하여 종이자료로 처리하게 되므로 자료처지과정은 기존의 종이질문지와 차이가 없었다.
소셜 미디어(social media)는 블로그, 소셜 네트워크, 위키 등과 같이 사용자의 참여로 만들어지는 정보 컨텐츠이다. 사용자가 작성한 질문에 다른 사용자들이 답변을하는 질문-답변 커뮤니티 서비스도 이러한 소셜 미디어의 한 가지로서 지난 몇 년간 많은 양의 정보를 축적해왔다. 하지만 축적된 질문-답변의 양이 많아질수록 이전의 질문을 정확히 검색하는 것은 점점 어려운 작업이 되고 있다. 본 논문에서는 질문-답변 커뮤니티의 효율적인 정보 검색을 위해 확장된 나이브 베이즈 분류기(Na$\ddot{i}$ve Bayes classifier)를 이용하여 질문을 그 목적에 따라 정보형, 제안형, 의견형으로 자동 분류하는 기법을 제안한다. 정확한 분류를 위해 분류기는 질문-답변 문서의 구조적인 특징을 활용한다. 실제 질문-답변 커뮤니티의 질문들에 대해 실험을 수행한 결과 71.2%의 분류 정확도를 보였다.
본 연구는 협력형 디지털 참고서비스인 '사서에게 물어보세요'의 지식정보DB에 수록된 질문과 답변을 분석하여 이용자 요구현황을 파악해 이를 바탕으로 서비스 초창기의 정보 이용행태를 도출하였다. 지식정보DB 3,506건 중 1,124건의 DB 항목 데이터를 ① 질문의 개수와 참고 질문 여부, ② 질문의 주제와 키워드, ③ 질문의 목적, ④ 질문의 유형, ⑤ 이용자의 정보 요구, ⑥ 사서가 제공한 정보원과 참고 서비스, ⑦ 답변의 소요 일수와 상관관계, ⑧ 참여 도서관 수준, ⑨ 주제별 질문 유형, 총 9가지 기준으로 분석하였다. 그 결과, 첫째, 이용자는 유사한 주제의 질문을 한 번에 하나씩 요청하는 것이 아닌, 필요에 따라 다양한 주제의 참고 질문을 요청하였지만, 절반 이상의 전체 순수 참고질문은 문헌정보학 분야의 질문이었다. 둘째, 약 71.35%의 이용자는 '사서에게 물어보세요' 서비스를 특정 주제나 연구 문제와 관련된 정보 자원의 목록을 추천받기 위해 이용하고 있었으며 독서상황에 대한 참고 상담을 요구하는 질문도 존재하였다. 셋째, 이용자가 가장 선호하는 정보원은 서지 및 서지사항으로 나타났으며, 온라인 정보원의 경우 이용자는 상대적으로 선호하지 않았다. 넷째, 답변의 소요 일수는 질문의 유형과 참여 도서관의 수준에 따라 유의미한 차이가 남을 확인할 수 있었다. 다섯째, 총류 분야 질문의 목적을 분석한 결과 약 31.33%이 이용자 스스로가 해결 당위성을 가진 자발적 질문으로 나타났다.
본 논문에서는 제약기반 KBQA를 위한 질문분석 기술에 대해서 소개한다. 핵심개체와 속성에 대한 연결 모호성을 해소하기 위해서 세 종류의 제약정보 활용을 제안한다. 세 종류의 제약은 핵심개체에 기반한 제약, 의미정답유형에 기반한 제약, 속성단서에 기반한 제약이다. 제약을 위해서는 질문 내에서 핵심개체와 속성단서를 인식하여야 한다. 본 논문에서는 규칙과 휴리스틱에 기반한 핵심개체와 속성단서 인식 방법에 대해서 소개한다. 핵심개체와 속성단서 인식 실험은 구축된 229개의 질문을 대상으로 수행하였으며, 핵심개체와 속성단서가 모두 정확히 인식된 정확도(accuracy)가 57.21%이고, KBQA 대상질문에서는 71.08%를 보였다.
cQA(Community-based Question Answering) 시스템은 온라인 커뮤니티를 통해 사용자들이 질문을 남기고 답변을 작성할 수 있도록 만들어진 시스템이다. 신규 질문이 인입되면, 기존에 축적된 cQA 저장소에서 해당 질문과 가장 유사한 질문을 검색하고, 그 질문에 대한 답변을 신규 질문에 대한 답변으로 대체할 수 있다. 하지만, 키워드 매칭을 사용하는 전통적인 검색 방식으로는 문장에 내재된 의미들을 이용할 수 없다는 한계가 있다. 이를 극복하기 위해서는 의미적으로 동일한 문장들로 학습이 되어야 하지만, 이러한 데이터를 대량으로 확보하기에는 어려움이 있다. 본 논문에서는 질문이 제목과 내용으로 분리되어 있는 대량의 cQA 셋에서, 질문 제목과 내용을 의미 벡터 공간으로 사상하고 두 벡터의 상대적 거리가 가깝게 되도록 학습함으로써 의사(pseudo) 유사 의미의 성질을 내재화 하였다. 또한, 질문 제목과 내용의 의미 벡터 표현(representation)을 위하여, semi-training word embedding과 CNN(Convolutional Neural Network)을 이용한 딥러닝 기법을 제안하였다. 유사 질문 검색 실험 결과, 제안 모델을 이용한 검색이 키워드 매칭 기반 검색보다 좋은 성능을 보였다.
국립국어원의 온라인 가나다 서비스는 한국어에 대한 다양한 질문과 정확한 답변을 제공한다. 만일 새롭게 등록되는 질문에 대해 유사한 질문을 자동으로 찾을 수 있다면, 질문자는 빠른 시간에 답변을 얻을 수 있고 서비스 관리자는 수동 답변 작성의 부담을 덜 수 있다. 본 논문에서는 국립국어원 질의응답게시판의 특성을 분석하여 질문의 주제를 6가지로 분류하고, 주제 분류 정보와 벡터 유사도, 수열 유사도를 결합하여 유사한 질문을 검색하는 시스템을 제안한다. 평가에서는 본 논문에서 제시한 주제 분류 정보를 활용한 결과 1위 정답 검색 정확률이 향상되는 결과를 얻었다. 최종 실험에서는 MRR이 0.62, 정답이 1위, 5위내에 검색될 확률은 각각 54.2%, 78.2%를 보였다.
본 웹사이트에 게시된 이메일 주소가 전자우편 수집 프로그램이나
그 밖의 기술적 장치를 이용하여 무단으로 수집되는 것을 거부하며,
이를 위반시 정보통신망법에 의해 형사 처벌됨을 유념하시기 바랍니다.
[게시일 2004년 10월 1일]
이용약관
제 1 장 총칙
제 1 조 (목적)
이 이용약관은 KoreaScience 홈페이지(이하 “당 사이트”)에서 제공하는 인터넷 서비스(이하 '서비스')의 가입조건 및 이용에 관한 제반 사항과 기타 필요한 사항을 구체적으로 규정함을 목적으로 합니다.
제 2 조 (용어의 정의)
① "이용자"라 함은 당 사이트에 접속하여 이 약관에 따라 당 사이트가 제공하는 서비스를 받는 회원 및 비회원을
말합니다.
② "회원"이라 함은 서비스를 이용하기 위하여 당 사이트에 개인정보를 제공하여 아이디(ID)와 비밀번호를 부여
받은 자를 말합니다.
③ "회원 아이디(ID)"라 함은 회원의 식별 및 서비스 이용을 위하여 자신이 선정한 문자 및 숫자의 조합을
말합니다.
④ "비밀번호(패스워드)"라 함은 회원이 자신의 비밀보호를 위하여 선정한 문자 및 숫자의 조합을 말합니다.
제 3 조 (이용약관의 효력 및 변경)
① 이 약관은 당 사이트에 게시하거나 기타의 방법으로 회원에게 공지함으로써 효력이 발생합니다.
② 당 사이트는 이 약관을 개정할 경우에 적용일자 및 개정사유를 명시하여 현행 약관과 함께 당 사이트의
초기화면에 그 적용일자 7일 이전부터 적용일자 전일까지 공지합니다. 다만, 회원에게 불리하게 약관내용을
변경하는 경우에는 최소한 30일 이상의 사전 유예기간을 두고 공지합니다. 이 경우 당 사이트는 개정 전
내용과 개정 후 내용을 명확하게 비교하여 이용자가 알기 쉽도록 표시합니다.
제 4 조(약관 외 준칙)
① 이 약관은 당 사이트가 제공하는 서비스에 관한 이용안내와 함께 적용됩니다.
② 이 약관에 명시되지 아니한 사항은 관계법령의 규정이 적용됩니다.
제 2 장 이용계약의 체결
제 5 조 (이용계약의 성립 등)
① 이용계약은 이용고객이 당 사이트가 정한 약관에 「동의합니다」를 선택하고, 당 사이트가 정한
온라인신청양식을 작성하여 서비스 이용을 신청한 후, 당 사이트가 이를 승낙함으로써 성립합니다.
② 제1항의 승낙은 당 사이트가 제공하는 과학기술정보검색, 맞춤정보, 서지정보 등 다른 서비스의 이용승낙을
포함합니다.
제 6 조 (회원가입)
서비스를 이용하고자 하는 고객은 당 사이트에서 정한 회원가입양식에 개인정보를 기재하여 가입을 하여야 합니다.
제 7 조 (개인정보의 보호 및 사용)
당 사이트는 관계법령이 정하는 바에 따라 회원 등록정보를 포함한 회원의 개인정보를 보호하기 위해 노력합니다. 회원 개인정보의 보호 및 사용에 대해서는 관련법령 및 당 사이트의 개인정보 보호정책이 적용됩니다.
제 8 조 (이용 신청의 승낙과 제한)
① 당 사이트는 제6조의 규정에 의한 이용신청고객에 대하여 서비스 이용을 승낙합니다.
② 당 사이트는 아래사항에 해당하는 경우에 대해서 승낙하지 아니 합니다.
- 이용계약 신청서의 내용을 허위로 기재한 경우
- 기타 규정한 제반사항을 위반하며 신청하는 경우
제 9 조 (회원 ID 부여 및 변경 등)
① 당 사이트는 이용고객에 대하여 약관에 정하는 바에 따라 자신이 선정한 회원 ID를 부여합니다.
② 회원 ID는 원칙적으로 변경이 불가하며 부득이한 사유로 인하여 변경 하고자 하는 경우에는 해당 ID를
해지하고 재가입해야 합니다.
③ 기타 회원 개인정보 관리 및 변경 등에 관한 사항은 서비스별 안내에 정하는 바에 의합니다.
제 3 장 계약 당사자의 의무
제 10 조 (KISTI의 의무)
① 당 사이트는 이용고객이 희망한 서비스 제공 개시일에 특별한 사정이 없는 한 서비스를 이용할 수 있도록
하여야 합니다.
② 당 사이트는 개인정보 보호를 위해 보안시스템을 구축하며 개인정보 보호정책을 공시하고 준수합니다.
③ 당 사이트는 회원으로부터 제기되는 의견이나 불만이 정당하다고 객관적으로 인정될 경우에는 적절한 절차를
거쳐 즉시 처리하여야 합니다. 다만, 즉시 처리가 곤란한 경우는 회원에게 그 사유와 처리일정을 통보하여야
합니다.
제 11 조 (회원의 의무)
① 이용자는 회원가입 신청 또는 회원정보 변경 시 실명으로 모든 사항을 사실에 근거하여 작성하여야 하며,
허위 또는 타인의 정보를 등록할 경우 일체의 권리를 주장할 수 없습니다.
② 당 사이트가 관계법령 및 개인정보 보호정책에 의거하여 그 책임을 지는 경우를 제외하고 회원에게 부여된
ID의 비밀번호 관리소홀, 부정사용에 의하여 발생하는 모든 결과에 대한 책임은 회원에게 있습니다.
③ 회원은 당 사이트 및 제 3자의 지적 재산권을 침해해서는 안 됩니다.
제 4 장 서비스의 이용
제 12 조 (서비스 이용 시간)
① 서비스 이용은 당 사이트의 업무상 또는 기술상 특별한 지장이 없는 한 연중무휴, 1일 24시간 운영을
원칙으로 합니다. 단, 당 사이트는 시스템 정기점검, 증설 및 교체를 위해 당 사이트가 정한 날이나 시간에
서비스를 일시 중단할 수 있으며, 예정되어 있는 작업으로 인한 서비스 일시중단은 당 사이트 홈페이지를
통해 사전에 공지합니다.
② 당 사이트는 서비스를 특정범위로 분할하여 각 범위별로 이용가능시간을 별도로 지정할 수 있습니다. 다만
이 경우 그 내용을 공지합니다.
제 13 조 (홈페이지 저작권)
① NDSL에서 제공하는 모든 저작물의 저작권은 원저작자에게 있으며, KISTI는 복제/배포/전송권을 확보하고
있습니다.
② NDSL에서 제공하는 콘텐츠를 상업적 및 기타 영리목적으로 복제/배포/전송할 경우 사전에 KISTI의 허락을
받아야 합니다.
③ NDSL에서 제공하는 콘텐츠를 보도, 비평, 교육, 연구 등을 위하여 정당한 범위 안에서 공정한 관행에
합치되게 인용할 수 있습니다.
④ NDSL에서 제공하는 콘텐츠를 무단 복제, 전송, 배포 기타 저작권법에 위반되는 방법으로 이용할 경우
저작권법 제136조에 따라 5년 이하의 징역 또는 5천만 원 이하의 벌금에 처해질 수 있습니다.
제 14 조 (유료서비스)
① 당 사이트 및 협력기관이 정한 유료서비스(원문복사 등)는 별도로 정해진 바에 따르며, 변경사항은 시행 전에
당 사이트 홈페이지를 통하여 회원에게 공지합니다.
② 유료서비스를 이용하려는 회원은 정해진 요금체계에 따라 요금을 납부해야 합니다.
제 5 장 계약 해지 및 이용 제한
제 15 조 (계약 해지)
회원이 이용계약을 해지하고자 하는 때에는 [가입해지] 메뉴를 이용해 직접 해지해야 합니다.
제 16 조 (서비스 이용제한)
① 당 사이트는 회원이 서비스 이용내용에 있어서 본 약관 제 11조 내용을 위반하거나, 다음 각 호에 해당하는
경우 서비스 이용을 제한할 수 있습니다.
- 2년 이상 서비스를 이용한 적이 없는 경우
- 기타 정상적인 서비스 운영에 방해가 될 경우
② 상기 이용제한 규정에 따라 서비스를 이용하는 회원에게 서비스 이용에 대하여 별도 공지 없이 서비스 이용의
일시정지, 이용계약 해지 할 수 있습니다.
제 17 조 (전자우편주소 수집 금지)
회원은 전자우편주소 추출기 등을 이용하여 전자우편주소를 수집 또는 제3자에게 제공할 수 없습니다.
제 6 장 손해배상 및 기타사항
제 18 조 (손해배상)
당 사이트는 무료로 제공되는 서비스와 관련하여 회원에게 어떠한 손해가 발생하더라도 당 사이트가 고의 또는 과실로 인한 손해발생을 제외하고는 이에 대하여 책임을 부담하지 아니합니다.
제 19 조 (관할 법원)
서비스 이용으로 발생한 분쟁에 대해 소송이 제기되는 경우 민사 소송법상의 관할 법원에 제기합니다.
[부 칙]
1. (시행일) 이 약관은 2016년 9월 5일부터 적용되며, 종전 약관은 본 약관으로 대체되며, 개정된 약관의 적용일 이전 가입자도 개정된 약관의 적용을 받습니다.