Abstract
This paper proposes a method that discriminates signal peptide and predicts the cleavage site of the secretory proteins cleaved by the signal peptidase I. The preprocessing stage uses hydrophobicity scales of amino acids in order to predict the presence of signal sequence and the cleavage site. The preprocessing enhances the performance of the prediction method by eliminating the non-secretory proteins in the early stage of prediction. for the effective use of support vector machine for the signal sequence prediction, the biologically relevant distance between the amino acid sequences is defined by using the hydrophobicity and substitution matrix; the hydrophobicity can be used to Predict the location of amino acid in a cell and the substitution matrix represents the evolutionary relationships of amino acids. The proposed method showed 98.9% discrimination rates from signal sequences and 88% correct rate of the cleavage site prediction on Swiss-Prot release 50 protein database using the 5-fold-cross-validation. In the comparison tests, the proposed method has performed significantly better than other prediction methods.
본 논문에서는 미지의 아미노산 서열이 신호 펩티다제 I에 의해 절단되는 분비성 단백질인지를 판별하고, 분비성 단백질일 경우에는 절단 위치를 예측하는 방법을 제안한다. 아미노산의 소수성을 이용한 전처리를 수행하여 분비성 단백질의 선도서열인 신호서열의 존재와 절단 위치를 추정한다. 전처리를 통해서 신호서열 아닌 서열을 초기에 제외함으로써 신호서열 예측의 정확도를 높인다. 지지벡터기계를 신호서열의 예측에 효과적으로 적용하기 위해서, 생물학적 정보와 관련된 아미노산 서열간의 거리를 제안한다. 아미노산의 세포내 위치를 예측할 수 있는 소수성 척도와 아미노산의 진화적인 관계를 나타낼 수 있는 치환행렬을 이용하여 아미노산 서열간의 거리를 정의한다. Swiss-Prot release 50 단백질 자료에 대하여 교차타당성 기법을 사용하여 실험한 결과 제안한 방법은 신호서열중에 98.9%를 신호서열로 판별하였고, 88%의 절단위치 예측정확도를 보였다. 기존의 방법과의 비교실험을 통해서 제안한 방법이 신호서열의 예측에 더욱 효과적임을 확인하였다.