• Title/Summary/Keyword: 용어추출

Search Result 365, Processing Time 0.03 seconds

Measuring the Specificity of Korean Terms Using Modifiers (수식어구를 이용한 한국어 용어의 전문성 측정)

  • Koo Heekwan;Jung Hanmin;Lee Byeong-Hee;Sung Won-Kyung
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2005.07b
    • /
    • pp.439-441
    • /
    • 2005
  • 용어의 전문성은 전문용어의 판넬 기준을 정하고 그 계층구조를 밝히는데 유용하다. 본 논문에서는 말뭉치로부터 추출한 한국어 용어의 전문성을 측정하는 효과적인 방법을 제안한다. 말뭉치에서 관형형 전성어미('ㄴ/은/는')가 부여된 전문용어와 함께 출현하는 수식어구는 일반명사의 수식어구보다 제한적인 형태로 나타난다. 이런 점에 착안하여 본 논문에서는 수식어구를 포함하는 문맥정보에 대해 엔트로피를 측정하여 용어의 전문성을 측정하였다. 이를 위해 한국어 수식어구를 분석하고 기존 전문성 측정 방법에서 간과되어진 수식어구 출현빈도를 고려하여 엔트로피를 상대적 비율로 계산함으로써 한국어에 적합한 전문성 측정을 하였다. 400만 어절의 신문 말뭉치에서 추출한 전문용어와 ETRI 시소러스를 이용하여 실험을 해 본 결과 본 논문에서 제안하는 한국어 용어 전문성 측정방법이 효과적임을 알 수 있었다.

  • PDF

A Relation Analysis between NDSL User Queries and Technical Terms (NDSL 검색 질의어와 기술용어간의 관계에 대한 분석적 연구)

  • Kang, Nam-Gyu;Cho, Min-Hee;Kwon, Oh-Seok
    • Journal of Information Management
    • /
    • v.39 no.3
    • /
    • pp.163-177
    • /
    • 2008
  • In this paper, we analyzed the relationship between user query keywords that is used to search NDSL and technical terms extracted from NDSL journals. For the analysis, we extracted about 833,000 query keywords from NDSL search logs during nearly 17 months and approximately 41,000,000 technical terms from NDSL, INSPEC, FSTA journals. And we used only the English noun phrase in extracted those and then we did an experiment on analysis of equality, relationship analysis and frequency analysis.

A study on the Algorithm for automated extraction for chemical term in Korean patents (국내 특허 문헌 내 화학 용어 자동 추출을 위한 알고리즘 연구)

  • Lee, Hayoung;Kim, Hongki;Park, Jinwoo
    • Proceedings of the Korean Society of Computer Information Conference
    • /
    • 2019.07a
    • /
    • pp.273-276
    • /
    • 2019
  • 본 논문에서는 열 및 전기특성 플라스틱 복합수지와 한글에 특화된 인공지능 기술을 개발하기 위한 조성/물성 정보 복합수지 지식베이스를 구축하고자 국내 특허 문헌에서 화학 용어를 추출하고자 한다. 이를 위해 전문용어가 많이 쓰인 특허 문헌의 특수성을 고려하여 UIMA(Unstructured Information Management Architecture) 규칙 기반의 라이브러리를 사용해 한국어 화학 용어 코퍼스를 구축하고 이를 기반으로 딥러닝 알고리즘 중 하나인 Bidirectional LSTM-CRF를 기반으로 특허 문헌에서 화학 용어를 자동으로 추출하는 알고리즘을 연구하고자 한다.

  • PDF

Automatic Extraction of Technical Terminologies from Scientific Text based on Hidden Markov Model (은닉마르코프 모델(HMM)을 이용한 과학기술문서에서의 외래어 추출 모델)

  • Oh, Jong-Hoon;Choi, Key-Sun
    • Annual Conference on Human and Language Technology
    • /
    • 1999.10e
    • /
    • pp.137-141
    • /
    • 1999
  • 기술의 발달로 인해 수많은 용어들이 생성되고 있다. 이들은 대부분 전문용어이며 이는 비영어권 국가인 우리나라에 도입될 때, 외래어나 원어형태로 도입된다. 그런데 외래어나 원어형태의 전문용어는 형태소 분석기, 색인기 등의 시스템에서 오류의 원인이 되어, 이를 전처리기로 사용하는 자연언어처리 시스템의 성능을 저하 시킨다. 따라서 본 논문에서는 외래어나 원어로 된 전문용어를 처리하기 위한 전단계로서 문서에서 자동적으로 외래어를 인식하고 추출하는 방법을 제시한다. 본 논문에서 제시하는 방법은 외래어 추출 문제를 태깅문제로 변환하여, 태깅 문제를 해결하는 기법 중의 하나인 은닉마르코프 모델 (Hidden Markov Model)을 이용하여 외래어 추출을 하였다. 그 결과 94.90%의 재현률과 95.41%의 정확도를 나타내었다.

  • PDF

Science and Technology Terminology Dictionary Building Process and Workbench Development in Defense Area (국방과학기술 전문용어 사전 구축을 위한 프로세스 및 워크벤치 개발)

  • Choi, Jung-Whoan;Park, Jeong-Ho;Kim, Kyung-Sun;Kim, Pyung
    • The Journal of the Korea Contents Association
    • /
    • v.12 no.8
    • /
    • pp.420-428
    • /
    • 2012
  • To improve the efficiency of business, it is important to standardize the meaning of terminology. And then, terminology dictionaries have been actively being built and used in various fields. In defense area, the publication of defense terminology dictionary is useful for information exchange of each army and distribution of standardized terminology. Defense agency for technology and quality(DTaQ) publishes terminology dictionary of defense science and technology on a three-year cycle. DTaQ tries to standardize the construction process of terminology dictionary and improve service efficiency by using terminology dictionary in defense area. This proposed method is based on the result of previous study about standardization of terminology dictionary. We suggest the practical steps including terminology dictionary constructing process, composition and role of organization, definition of headword, selection of target documents to be extracted terminology candidate, terminology extraction, generation of terminology candidate group, workbench registration, construction and validation of terminology dictionary. Thesaurus and workbench are developed to use and support terminology dictionary effectively.

Use of SNOMED CT to Represent Traditional Korean Medicine Concepts : A Semantic Characterization of Migraine-Related Concepts from Korean Medicine Clinical Practice Guideline (SNOMED CT를 활용한 한의약 개념 매핑 : 한의임상진료지침에서 도출된 편두통 관련 개념의 의미론적 표현)

  • Ahjung Byun;Hyeoun-Ae Park;Byung-Kwan Seo;EunYong Lee;Hyeoneui Kim
    • Journal of Society of Preventive Korean Medicine
    • /
    • v.28 no.2
    • /
    • pp.85-97
    • /
    • 2024
  • 목적 : 본 연구는 한의약에서 사용하는 용어가 SNOMED CT로 매핑 가능한지 여부를 조사하고, 한의약 용어를 표현하기 위해 기존 SNOMED CT 온톨로지를 개선할 수 있는 방안을 제안하는 것을 목표로 하였다. 방법 : 선행 연구의 매핑 가이드라인에서 제시된 7단계 과정을 수정하여 활용하였다. 매핑의 목적 및 범위 정의, 용어 추출, 개념 추출, 매핑을 위한 소스 용어 작업, SNOMED CT 개념 검색, 매핑 관계 분류 및 매핑 검증의 과정을 수행하였다. 매핑의 목적은 한의약 임상 아이디어를 표현하는 표준 용어로서 SNOMED CT를 평가하는 것이고, 범위에는 편두통 환자 관리의 평가, 진단, 치료 및 예방을 포함하였다. 결과 : 총 546개의 용어가 추출되었다. 중복된 용어를 제거한 후, 271개의 개념이 SNOMED CT 매핑에 사용되었다. 이중 43.2%는 SNOMED CT 개념과 의미론적으로 동등하게 매핑되었고(117개 개념), 39.1%는 SNOMED CT 개념이 더 포괄적인 의미를 가지도록 매핑되었다(106개 개념). 상대적으로 포괄적인 의미를 가지는 SNOMED CT 개념에 매핑된 한의약 개념 106개 중 19개는 SNOMED CT 후조합을 이용하여 의미론적으로 동등하게 표현이 가능하였다. 나머지 17.7%의 한의약 개념은 SNOMED CT에 매핑할 수 없었다. 결론 : 본 연구는 한의약에서 사용되는 개념을 SNOMED CT에 매핑하여 한의약 용어를 표준화하였다. 연구 결과를 바탕으로, 한의약에서 사용되는 용어를 표준의료용어로 표현하기 위하여 SNOMED CT에 새로운 개념과 속성을 추가하는 것을 제안한다.

Extraction and Ranking of Term Usages using Usage Vector and Web Resources (용례 벡터와 웹 자원을 이용한 전문용어 용례의 추출 및 순위화)

  • Jung, Ha-Yong;Choi, Key-Sun
    • Proceedings of the Korean Society for Cognitive Science Conference
    • /
    • 2006.06a
    • /
    • pp.95-101
    • /
    • 2006
  • 전문용어의 용례는 일반용어의 용례와 다르게 의미를 드러내는 것이 중요하다. 또한 사전 및 시소러스와 같은 자원이 부족하다는 특징이 있다. 본 논문에서 우리는 전문용어의 용례를 벡터를 이용한 표현을 통해 더 정량적으로 나타내는 방법을 제안했다. 또한 전문용어의 자료부족 문제를 극복하기 위해 대체적 자원으로 웹을 이용하는 것을 제안했다. 실험 결과, 제안한 시스템은 기존의 시스템에 비해 최대 30%의 성능 향상을 이룰 수 있었다. 게다가 제안한 시스템에의 추출된 전문용어의 용례는 다른 자연어 처리 응용을 위한 보완적 자원으로서의 가능성을 보여줬다.

  • PDF

Toward IT Domain Thesaurus: An Engineering Approach (정보산업 분야 시소러스의 공학적 구축 방안)

  • Ryu, Pum-Mo;Kim, Jae-Ho;Choi, Key-Sun;Sung, Brian W.K.
    • Annual Conference on Human and Language Technology
    • /
    • 2005.10a
    • /
    • pp.13-20
    • /
    • 2005
  • 이 논문은 공학적인 접근 방법에 기반한 단계적인 전문분야 시소러스 구축 방법을 제안한다. 시소러스 구축 과정은 용어 추출 단계, 용어 분류 단계, 계층 구조 구축 의 3단계로 구성되고, 모든 단계에서 자동 처리와 전문가 검증 작업을 거친다. 추출된 용어를 미리 정해진 분류 체계에 따라 분리한 후 여러 개의 작은 시소러스를 구축하고, 마지막으로 전체 시소러스로 결합한다. 이 방법은 1) 시소러스를 구축하는 복잡도가 줄어들고, 2) 클래스 단위의 작은 시소러스가 다른 전문분야 시소러스에 쉽게 재사용 될 수 있으며, 3) 각 클래스에 포함된 용어들의 분포를 쉽게 판단할 수 있는 장점이 있다. 제안한 방법을 이용하여 한국어 정보기술 분야 시소러스를 구축하였다. 시소러스 구축에 사용된 용어들은 정보기술 분야의 최근의 한국어 신문과 특허 문서에서 추출하였기 때문에 한국에서 만들어진 신조어를 포함한다. 구축된 시소러스는 81 개의 상위 레벨클래스와 1,000개 이상의 용어로 구성된다.

  • PDF

A Study on Term Life Cycle for Science & Technology Terms -Focused on 'ETNEWS' Corpus- (과학기술 용어에 대한 용어 생명주기 고찰 -전자신문 말뭉치를 중심으로-)

  • Jung, Han-Min;Sung, Won-Kyung
    • Proceedings of the Korea Contents Association Conference
    • /
    • 2006.11a
    • /
    • pp.84-89
    • /
    • 2006
  • Keeping pace with the speed of development of science & technology domain, the domain terms continuously repeat the step of creation and extinction. This study tries to define term life cycle and analyze extracted terms from a large corpus with the viewpoint. We chose 'ETNEWS' corpus which includes about 17 million Eojeols for 12 years because it is easy to inspect the transition of term life cycle and the corpus represents computer, IT, and electrotechnology domains. This study acquired several useful conclusions including the relation between specificity and life of terms. We expect that term life cycle will contribute to analyze the competition of similar technologies and determine which term be registered into general dictionary.

  • PDF

Automatic Gene Ontology Extension and Terminology Analysis (유전자 온톨로지의 자동 확장과 용어 분석)

  • 이진복;박종철
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2002.10d
    • /
    • pp.229-231
    • /
    • 2002
  • 생물학 분야의 방대한 지식을 효율적으로 다루기 위하여 생물정보학이 주요한 연구 분야가 되었다. 이중 특히 생물학 문헌에서 정보를 자동으로 추출하는 연구가 활발히 진행되고 있는데, 이러한 정보추출 결과를 이용하여 유전자 온톨로지와 같은 유용한 지식베이스를 자동으로 확장함으로써 폭발적으로 증가하는 생물학 분야의 연구 결과들을 지식베이스에 통합할 수 있다. 자동으로 확장된 온톨로지는 신뢰성을 보장하기 위한 검증 과정을 거쳐, 정보추출 시스템의 성능을 향상시키기 위한 지식베이스로 사용되게 된다. 본 연구에서는 단백질 간의 상호작용에서 나타나는 조건을 추출하는 시스템과 유전자 온톨로지를 이용하여 추출된 생물학 용어를 분석하는 시스템을 제안하고 유전자 온톨로지의 자동 확장 및 검증 시스템에 대하여 논의한다.

  • PDF