• 제목/요약/키워드: term weighting method

검색결과 66건 처리시간 0.029초

제목의 단어 가중치를 이용한 중등학교 공문서 자동분류시스템 (An Automatic Classification System of Official Documents in Middle Schools Using Term Weighting of Titles)

  • 강현희;진민
    • 정보교육학회논문지
    • /
    • 제7권2호
    • /
    • pp.219-226
    • /
    • 2003
  • 현재 일선 학교와 교육기관의 공문서 분류는 아직도 수작업으로 처리되고 있어 많은 시간이 소요된다. 이러한 문제점을 해결하기 위해 본 논문은 문서 제목의 단어 정보를 이용한 자동 문서 분류 방법을 제안한다. 먼저 기존 문서의 제목 단어 중에서 의미 있는 단어를 추출하여 각 단어에 대해 범주별로 역문헌 빈도(IDF) 가중치를 계산한 후 단어 가중치 사전을 구축한다. 문서의 분류 요구가 들어오면 구축된 단어 가중치 사전을 이용하여 문서 제목에 포함된 단어들의 범주별 가중치 합을 비교하여, 범주별 가중치 합이 최대인 범주로 문서를 분류한다. 실제 중등학교에서의 공문서를 대상으로 제안된 방법의 분류 성능을 평가하였다.

  • PDF

Chatbot Design Method Using Hybrid Word Vector Expression Model Based on Real Telemarketing Data

  • Zhang, Jie;Zhang, Jianing;Ma, Shuhao;Yang, Jie;Gui, Guan
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제14권4호
    • /
    • pp.1400-1418
    • /
    • 2020
  • In the development of commercial promotion, chatbot is known as one of significant skill by application of natural language processing (NLP). Conventional design methods are using bag-of-words model (BOW) alone based on Google database and other online corpus. For one thing, in the bag-of-words model, the vectors are Irrelevant to one another. Even though this method is friendly to discrete features, it is not conducive to the machine to understand continuous statements due to the loss of the connection between words in the encoded word vector. For other thing, existing methods are used to test in state-of-the-art online corpus but it is hard to apply in real applications such as telemarketing data. In this paper, we propose an improved chatbot design way using hybrid bag-of-words model and skip-gram model based on the real telemarketing data. Specifically, we first collect the real data in the telemarketing field and perform data cleaning and data classification on the constructed corpus. Second, the word representation is adopted hybrid bag-of-words model and skip-gram model. The skip-gram model maps synonyms in the vicinity of vector space. The correlation between words is expressed, so the amount of information contained in the word vector is increased, making up for the shortcomings caused by using bag-of-words model alone. Third, we use the term frequency-inverse document frequency (TF-IDF) weighting method to improve the weight of key words, then output the final word expression. At last, the answer is produced using hybrid retrieval model and generate model. The retrieval model can accurately answer questions in the field. The generate model can supplement the question of answering the open domain, in which the answer to the final reply is completed by long-short term memory (LSTM) training and prediction. Experimental results show which the hybrid word vector expression model can improve the accuracy of the response and the whole system can communicate with humans.

Individual Variation of Na Intake and Urinary Excretion in Korean Women

  • Park, Jung-A;Yoon, Jin-Sook
    • Journal of Community Nutrition
    • /
    • 제1권2호
    • /
    • pp.119-124
    • /
    • 1999
  • The purpose of this study is to investigate the daily variation of Na intake as measured by dietary methods(weighing vs food analysis) and to examine the difference between urniary Na excretion and dietary Na intake in 9 healthy free living women aged 25-64 years living in Taegu, Korea. Information on the dietary Na intake for 5 consecutive days was collected using he weighing method. Twenty four-hour urine samples were collected for the same period to measure the urinary Na excretion. In order to figure out the difference of Na intake with respect to dietary assessment methodology, dietary intake was measured by the weighing method for three of a total 5 days. At the same time, the meals that subjects consumed each day were collected to analyze daily intake of each subject by the food analysis method. The mean Na intake of subjects for 5 consecutive days by the weighing method was 3558. 5mg. The mean of urinary Na excretion for the same period was 2847.5mg/ Na intake and Urinary Na excretion of each subject ranged from 4475.3 to 2838.4, from 4066.4rmg to 1936.1mg respectively. The mean of Na intake for 3 days by the analysis method and the weighing method were 3044.6mg and 3441.6mg, respectively. Each subject showed a great difference among day-to-day variation of Na intake by the weighting method, analysis method and urinary Na excretion method. Therefore, a short term study period may not be valid to estimate the true average Na intake.

  • PDF

단어 가중치를 이용한 스팸메일 필터링 (A Filtering Method of Spam E-mails by Term Weighting)

  • 김호성;정경호;황도삼
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2001년도 제13회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.171-174
    • /
    • 2001
  • 현재, 전자메일을 정보전달의 수단이나 광고등의 목적으로 많이 이용하게 되면서, 메일 수신자는 원치 않는 상업적 광고, 불필요한 정보등의 스팸메일을 여과 없이 수신하게 되는 경우가 많아졌다. 이로 인하여 업무효율성 감퇴, 시간 낭비, 자원 낭비 등의 많은 문제점을 야기시키고 있다. 이러한 문제점을 해결하기 위한 기존의 메일 필터링 시스템들은 송신자의 주소나 도메인, 제목 등의 메일 헤더정보만을 이용하거나, 사용자가 정의한 문장이 본문 내용에 나타날 때 필터링하는 방식들이 주류를 이루고 있다. 그러나 이러한 방식들은 메일의 내용에 대한 근본적인 필터링이 불가능하다. 본 논문에서는 메일의 내용을 파악하기 위해 메일의 내용을 대표할 수 있는 체언정보를 추출하여, 카이제곱 통계량 공식을 통해 단어 가중치를 부여하고, 이를 문서분류를 위한 로그단어 빈도 가중치 공식에 적용하여 스팸메일을 필터링하는 방식을 제시한다. 본 논문에서 제안한 방법으로 실험한 결과, 스팸메일을 필터링하는데 84.61%의 재현율과 83.01%의 정확율을 얻을 수 있었다.

  • PDF

로봇팔의 장애물 중에서의 시간 최소화 궤도 계획 (Minimum-Time Trajectory Planning for a Robot Manipulator amid Obstacles)

  • 박종근
    • 한국정밀공학회지
    • /
    • 제15권1호
    • /
    • pp.78-86
    • /
    • 1998
  • This paper presents a numerical method of the minimum-time trajectory planning for a robot manipulator amid obstacles. Each joint displacement is represented by the linear combination of the finite-term quintic B-splines which are the known functions of the path parameter. The time is represented by the linear function of the same path parameter. Since the geometric path is not fixed and the time is linear to the path parameter, the coefficients of the splines and the time-scale factor span a finite-dimensional vector space, a point in which uniquely represents the manipulator motion. The displacement, the velocity and the acceleration conditions at the starting and the goal positions are transformed into the linear equality constraints on the coefficients of the splines, which reduce the dimension of the vector space. The optimization is performed in the reduced vector space using nonlinear programming. The total moving time is the main performance index which should be minimized. The constraints on the actuator forces and that of the obstacle-avoidance, together with sufficiently large weighting coefficients, are included in the augmented performance index. In the numerical implementation, the minimum-time motion is obtained for a planar 3-1ink manipulator amid several rectangular obstacles without simplifying any dynamic or geometric models.

  • PDF

수문기상가뭄지수 (HCDI) 개발 및 가뭄 예측 효율성 평가 (Development of Hydroclimate Drought Index (HCDI) and Evaluation of Drought Prediction in South Korea)

  • 류재현;김정진;이경도
    • 한국농공학회논문집
    • /
    • 제61권1호
    • /
    • pp.31-44
    • /
    • 2019
  • The main objective of this research is to develop a hydroclimate drought index (HCDI) using the gridded climate data inputs in a Variable Infiltration Capacity (VIC) modeling platform. Typical drought indices, including, Standardized Precipitation Index (SPI), Standardized Precipitation Evapotranspiration Index (SPEI), and Self-calibrated Palmer Drought Severity Index (SC-PDSI) in South Korea are also used and compared. Inverse Distance Weighting (IDW) method is applied to create the gridded climate data from 56 ground weather stations using topographic information between weather stations and the respective grid cell ($12km{\times}12km$). R statistical software packages are used to visualize HCDI in Google Earth. Skill score (SS) are computed to evaluate the drought predictability based on water information derived from the observed reservoir storage and the ground weather stations. The study indicates that the proposed HCDI with the gridded climate data input is promising in the sense that it can help us to predict potential drought extents and to mitigate its impacts in a changing climate. The longer term drought prediction (e.g., 9 and 12 month) capability, in particular, shows higher SS so that it can be used for climate-driven future droughts.

곡관부 하류에 핀휜이 부착된 회전 냉각유로의 최적설계 (Optimization of a Rotating Two-Pass Rectangular Cooling Channel with Staggered Arrays of Pin-Fins)

  • 문미애;김광용
    • 한국유체기계학회 논문집
    • /
    • 제13권5호
    • /
    • pp.43-53
    • /
    • 2010
  • This study investigates a design optimization of a rotating two-pass rectangular cooling channel with staggered arrays of pin-fins. The radial basis neural network method is used as an optimization technique with Reynolds-averaged Navier-Stokes analysis of fluid flow and heat transfer with shear stress transport turbulent model. The ratio of the diameter to height of the pin-fins and the ratio of the streamwise spacing between the pin-fins to height of the pin-fin are selected as design variables. The optimization problem has been defined as a minimization of the objective function, which is defined as a linear combination of heat transfer related term and friction loss related term with a weighting factor. Results are presented for streamlines, velocity vector fields, and contours of Nusselt numbers, friction coefficients, and turbulent kinetic energy. These results show how fluid flow in a two-pass square cooling channel evolves a converted secondary flows due to Coriolis force, staggered arrays of pin-fins, and a $180^{\circ}$ turn region. These results describe how the fluid flow affects surface heat transfer. The Coriolis force induces heat transfer discrepancy between leading and trailing surfaces, having higher Nusselt number on the leading surface in the second pass while having lower Nusselt number on the trailing surface. Dean vortices generated in $180^{\circ}$ turn region augment heat transfer in the turning region and in the upstream region of the second pass. As the result of optimization, in comparison with the reference geometry, thermal performance of the optimum geometry shows the improvement by 30.5%. Through the optimization, the diameter of pin-fin increased by 14.9% and the streamwise distance between pin-fins increased by 32.1%. And, the value of objective function decreased by 18.1%.

하수관거시스템 개량 우선순위 결정 모형 (Rehabilitation Priority Decision Model for Sewer Systems)

  • 이정호;박무종;김중훈
    • 한국방재학회 논문집
    • /
    • 제8권6호
    • /
    • pp.7-14
    • /
    • 2008
  • 하수관거시스템 개량의 주된 목적은 불명수(Inflow/Infiltration, I/I)를 제거함으로써 그 성능을 향상시키는데 있다. 이때 전체 하수관거시스템 내에서 개개 관거별 I/I 발생량을 정량화할 수 있다면, 전체 하수관거시스템 내에서 소유역별 해당 정보의 추출이 보다 명확해질 수 있다. 그러나 실제 현장에서는 예산 및 시간의 제약 때문에 개개 관거의 I/I 발생 정보의 획득은 거의 불가능하다. 본 연구에서는 하수 관거별 I/I 발생량을 AHP(Analytic Hierarch Process)를 이용하여 정량화하였으며, 산정된 관거별 I/I 발생량을 이용하여 효율적인 하수과거 개량 사업 시행을 위한 개량 우선순위 결정 모형(Rehabiliation Priority Decision Model for sewer system, RPDM)을 개발하였다. 개개 관거별 I/I 발생량 산정 결과에 기반하여 RPDM은 개량이 시행되는 기간 동안 발생하는 I/I 발생량을 최소화하는 소유역별 최적 개량 우선순위(Optimal Rehabilitation Priority, ORP)를 유전자 알고리즘을 이용하여 결정한다. 이때 최적 개량 우선순위에 따른 소유역별 개량 시행 시 발생하는 이익은 개량 기간 동안 하수처리장으로 들어가는 I/I의 하수처리비용(Waste Water Treatment Cost, WWTC)에 대한 절감을 의미한다. 본 연구에서는 개발된 RPDM에 의한 최적 개량 우선순위의 결과는 일반적인 하수관거 개량사업의 우선순위 결정 방법인 점수가중평가법(Numerical Weighting Method, NWM)과 최악의 개량순서에 따른 결과들과 비교되었으며, 개량 기간 동안의 I/I 처리비용이 점수가중평가법에 비하여 22%, 최악의 개량순서에 비하여 40% 감소하는 것으로 나타났다.

사용자 질의를 이용한 XML 태그의 가중치 결정 (Weighting of XML Tag using User's Query)

  • 우선미;유춘식;김용성
    • 정보처리학회논문지D
    • /
    • 제12D권3호
    • /
    • pp.439-446
    • /
    • 2005
  • 보다 효과적인 색인어 추출 및 색인어 가중치 결정을 위하여 문서의 내용뿐만 아니라 구조를 이용하여 색인을 추출하는 연구가 이루어지고 있다. 이러한 연구들 대부분이 XML 태그의 중요도가 아닌, 문맥상의 단락에 대한 중요도를 계산하거나 HTML 문서 태그의 중요도를 결정하는 연구들이다. 이러한 기존 연구들은 대부분이 객관적인 실험을 통해서 중요도를 입증하기보다는 상식적인 관점에서 단순한 수치로 중요도를 결정하고 있다. 본 논문에서는 웹 문서 관리를 위한 표준으로 자리잡아가고 있는 XML 문서의 태그 정보를 이용한 자동색인을 위하여, 논문을 구성하는 주요 태그의 가중치를 계산하는 방법을 제안한다. 보다 객관적인 가중치 결정을 위하여 사용자의 질의에 바탕을 둔 사용자의 검색 행위를 반영한다. 그리고 기존 방법을 적용하여 계산된 색인어 가중치를 이용한 검색성능과 비교함으로써 본 논문에서 제안한 방법을 적용하여 계산된 색인어 가중치의 효과를 검증한다.

퍼지추론을 이용한 소수 문서의 대표 키워드 추출 (Representative Keyword Extraction from Few Documents through Fuzzy Inference)

  • 노순억;김병만;허남철
    • 한국지능시스템학회논문지
    • /
    • 제11권9호
    • /
    • pp.837-843
    • /
    • 2001
  • 본 논문은 사용자의 관심 내용을 포함하는 소수 문서들로부터 대표 용어들을 추출하고 가중치를 부여하는 새로운 방법을 제시한다. 대표 용어들의 추출 방법에서는 우선 예제 문서들로부터 후보 용어들을 추출하고 퍼지 추론을 적용하여 초기 대표 용어들을 선택한 수 예제 문서 내에서의 이들 용어들과 후보 용어들의 발생 빈도의 유사성을 이용하여 가중치를 재산정하고 대표 용어들을 자동 확장하였다. 제안 방법의 성능은 초기 대표 용어들을 선책하는 방법에 의해 영향을 크게 받는다. 따라서 문서집합에서 대표 용어를 추출하는 문제는 불확실성을 내포하고 있으므로 이러한 문제 해결에 효과적인 퍼지 추론을 초기 대표 용어의 선택 방법에 적용하였다. 본 논문에서 다루는 문제는 문서 집합의 중심 벡터를 계산하는 것으로 볼 수가 있다. 성능 평가를 위해 기존의 대표적인 Rocchio 알고리즘과 Widrow-Hoff 알고리즘과의 문서 분류 실험을 하였다. 실험 결과 우수한 성능을 보여줌으로서 제안 방법의 유용성을 확인 할 수 있었다.

  • PDF