• 제목/요약/키워드: 통사 주석

검색결과 7건 처리시간 0.029초

의미주석 표준 (Standards on Semantic Annotation)

  • 이기용
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2015년도 제27회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.3-8
    • /
    • 2015
  • 최근에 ISO/TC 37/SC 4 산하의 Working Group 2 Semantic annotation에서 자연언어의 의미주석에 관한 4 개의 국제표준을 완성하여 출판하였다. 그 중에서 2 개의 국제표준 ISO 24617-1 SemAF-Time(ISO-TimeML)[1]과 24617-7 ISOspace[2]를 간략히 소개하는 것이 이 발표의 목적이다. 자연언어 텍스트에서 전자는 사건과 관련된 시간 정보를 주석처리하고, 후자는 사건(event), 특히 운동(motion)과 관련된 공간 정보를 주석 처리하는 주석체계(annotation scheme)들을 구축, 기술하는 명세언어(specification language)이다. 이 표준들은 또한 ISO 24612:2012 LAF (Linguistic annotation framework)[3]의 제약조건들을 준수하며 언어 주석체계를 구축하였다. 오늘의 발표는 이들 두 개의 국제표준에 준한 주석체계들 ASisoTime과 ASisoSpace가 LAF를 따라 어떻게 구축되었는지 그 추상통사구조(abstract syntax)를 명시하고, 의미주석체계로서의 이들 주석체계의 타당성을 보이기 위하여 주석기반의 의미형식(semantic form)들을 체계적으로 도출하는 과정을 또한 보이도록 한다.

  • PDF

일본어의 Universal Dependency 태그셋 적용 사례 연구 - 한국어와의 비교를 중심으로 (A Case Study on Universal Dependency Tagsets of Japanes)

  • 이진;한지윤;김한샘
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2018년도 제30회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.323-328
    • /
    • 2018
  • 한국어는 교착어적 특성으로 인하여 어미와 조사가 매우 발달되어 있다. 그러므로 영어와 같은 굴절어를 중심으로 설계된 UD를 한국어에 적용하는 것에는 많은 어려움이 있다. 이를 해결하기 위해서 형태통사적 특성이 유사한 일본의 UD 적용 사례를 살펴보고 한국어의 UD 적용 양상과의 비교 분석을 통해서 한국어의 UD 적용 및 개선 방안을 고찰해 보고자 한다. 한국어와 일본어는 동일한 교착어로서 비슷한 특성을 지니고 있으나, 주석의 기본 단위 설정에서 차이를 보이면서 UD를 적용하는 양상이 달라졌음을 확인하였다. 일본어의 UD 주석에서 형태 분석 기본 단위인 단단위(Short unit word, 長單位)를 기본 구문 주석 단위로 하되 장단위(Long unit word, 短單位)와 문절 정보를 이용하는 것처럼, 한국어에서도 형태 분석 단위를 기준으로 의존 관계를 주석하는 방안에 대해서도 고려할 필요가 있다.

  • PDF

언어정보 DB 구축을 위한 문법적 주석 상의 몇 문제 - 기존 국어사전의 어휘 정보 수용과 관련된 문제를 중심으로 (Problems in Syntactic Annotation for Building a LDB in Korean)

  • 신선경;한영균
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1992년도 제4회 한글 및 한국어정보처리 학술대회
    • /
    • pp.73-81
    • /
    • 1992
  • 한 언어에 대한 포괄적인 언어정보 데이타베이스의 구축에 있어서는 수집된 텍스트에 대한 상세한 문법정보의 주석이 일차적 작업 대상이 된다. 이는 통사적 정보가 단순히 구문 분석상의 문제들을 해결하기 위한 정보를 제공해주는 것일 뿐 아니라 형태소 해석 및 문장 의미의 파악등 자연언어 이해시스템 전반의 성능을 향상시키는 데에 중요한 물을 차지하기 때문이다. 각개 단어의 문법적 기능에 대한 주석은 사전적 정의에 따른다면 "품사"로 표현할 수 있을 것이다. 그런데 품사는 각개 단어가 지니는 고유한 어휘의미적 정보이기보다는 구문구조에 의존적인 양상을 보인다. 이는 사전에 따라서 각개 단어에 대한 품사 정보가 달리 나타나는 점에서도 간취할 수 있는데, 한편으로 한국어 언어정보 데이타베이스 구축을 위한 문법적 주석에 있어서는 기존 사전의 품사정보에만 의존할 수는 없다는 문제점이 제기된다. 따라서 각 어휘들의 구문정보(흑은 품사정보)를 어떻게 기술할 것인가가 해결되어야 하는 것이다. 본 연구에서는 일차적으로 각 어휘들의 문장 안에서의 기능을 바탕으로 한 주석체계를 설정하고 그에 따라서 약 12만개의 문장에 대한 일차적 형식화를 수작업으로 처리하였다. 이는 향후 자동적으로 문법적 주석이 가능하도록 해주는 시스템의 개발을 지원하기 위한 언어정보의 수집에 목적을 둔 것인데, 이를 통해서 기존 국어사전에서의 언어정보상의 미비점을 수정 보완할 몇 가지 근거를 마련할 수 있었다.

  • PDF

다국어 범용 의존관계 주석체계(Universal Dependencies) 적용 연구 - 한국어와 일본어의 비교를 중심으로 (A Case Study on Universal Dependency Tagsets)

  • 한지윤;이진;이찬영;김한샘
    • 비교문화연구
    • /
    • 제53권
    • /
    • pp.163-192
    • /
    • 2018
  • 이 논문은 형태통사적 특성이 유사한 한국어와 일본어의 다국어 범용 의존관계 주석체계(Universal Dependencies, 이하 UD) 적용 사례를 살펴보고 비교 분석을 통해서 한국어의 UD 적용 및 개선 방안을 고찰하는 것을 목적으로 한다. 한국어와 일본어는 교착어적 특성으로 인하여 어미와 조사가 매우 발달되어 있다. 그러므로 영어와 같은 굴절어를 중심으로 설계된 UD를 적용하는 데에 많은 어려움이 있다. 이에 본고에서는 UD를 구성하는 범용 품사 주석(Universal POS, 이하 UPOS)과 범용 의존관계 주석(Universal Dependency Relations, 이하 DEPREL)의 적용과 그에 따른 논의들을 검토하였다. UPOS의 경우 AUX(조동사 표지), ADJ(형용사 표지), VERB(동사 표지)처럼 서술어와 관련된 주석 표지의 처리와 조사, 어미와 같은 기능어의 처리 방안을 살펴보았으며 접속사 및 이와 관련된 단위를 어떻게 처리하고 있는지 검토하였다. DEPREL과 관련해서는, 구문 표지를 주석하는 기본 단위의 문제에서 출발하여 통사적 문제를 어떻게 반영하고 있는지 살펴보았다. 지배소 설정 방식과 병렬 구조의 주석 방식, case(격 관계 표지)와 aux(조동사 관계 표지) 주석 방식을 검토하였다. 다양한 관계 주석 표지 중에서 특히 case와 aux에 집중하여 논의한 것은 한국어와의 주석 표지 적용 양상을 비교했을 때 분포 상 가장 두드러지는 차이를 나타내기 때문이다. case는 한국어와 일본어 모두 조사와 관련이 있고, aux는 한국어에서는 보조용언, 일본어에서는 조동사와 관련이 있는 표지이다. 구체적인 주석 양상을 살펴본 결과 일본어의 aux는 서법 조동사뿐만 아니라 동사에 문법적 의미를 더하는 요소, 한국어의 어미에 해당하는 형태에도 aux를 할당하기 때문에 주석이 차지하는 비율이 크게 차이가 나는 것으로 밝혀졌다. iobj(간접목적어 관계 표지)와 관련해서는 일본어에서 간접목적어를 인정하는 데에 반해 한국어에서는 간접목적어를 인정하지 않는 경우가 더 많았다. 일본어의 UD 주석에서 형태 분석 기본 단위인 '단단위'를 기본 구문 주석 단위로 하되 '장단위'와 문절 정보를 이용하는 것처럼, 한국어에서도 형태 분석 단위를 의존관계 주석의 정보로 활용하는 방안에 대해서 고려할 필요가 있다.

한국어 보편 의존 구문 분석(Universal Dependencies) 방법론 연구 (A Study on Universal Dependency Annotation for Korean)

  • 이찬영;오태환;김한샘
    • 언어사실과 관점
    • /
    • 제47권
    • /
    • pp.141-175
    • /
    • 2019
  • The purpose of this paper is to find a methodology for parsing Korean by the method of 'Universal Dependencies'. Universal Dependencies expresses the annotation marking system that can be applied to the formal patterns and syntactic relationships of various types of languages. The UD project presents a framework for consistently annotated multi-lingual treebank corpus for various languages around the world through the 'CoNLL shared task' and is currently applied to more than 50 languages. This flow has a great influence on research related to not only the UD project itself but also the syntactic annotation for individual languages, and efforts are being made to apply the universally dependent syntax analysis marking system in the UD according to the characteristic of the individual language. When annotation labels cannot be applied due to the nature of the Korean language in consideration of compatibility, they need to be excluded. Among DEPREL labels, several labels are difficult to apply in Korean when looking at the specific items. In this paper,, DEPREL overall annotation system of UD was translated and a representative category of elements that needed to be transformed was selected to discuss the actuality of linguistic convergence and its application.

현대 한국어 접속어미 '-니까'의 인지.화용론적 연구 시론 (A Cognitive Pragmatic Approach to Discourse Connectives)

  • 서성교
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1994년도 제6회 한글 및 한국어정보처리 학술대회
    • /
    • pp.460-475
    • /
    • 1994
  • 이 논문에서는 적합성 이론(Relevance Theory)에 의해서 현대 한국어 접속어미, 특히 담화표지(discourse marker) '-니까'가 담화의 이해에 어떻게 기여하는가를 고찰하고자 한다. '-니까'는 이제까지 '-(으)니-'와 별 의미나 기능의 차이가 없는 것으로 간주되어 왔는데, 이는 기존의 연구가 주로 통사 의미론적인 관점에서 수행되어 온 데 기인한다. 그러나 '-니까'는 엄연히 '-(으)니-'와 별개로 존재하고 있고, 더욱이 통시적으로 '-(으)니-' 보다는 '-니까'가 나중에 나타났다는 점을 고려한다면, '-니까'는 '-(으)니-'에 없는 특정한 기능을 반드시 수행하리라는 추측이 가능하다. 따라서 이 논문에서는 기존의 통사 의미적인 관점이 아닌 인지 화용론적 관점에서 '-(으)니-'와 '-니까'에 대한 새로운 분석을 시도하고자 한다. 아울러 '-니까'를 포함하는 '그러니까'도 함께 살펴보려고 한다. '그러니까'는 담화상에서 그에 선행하는 모든 정보를 맥락적 배경지식으로 놓고, 후속되는 발화를 그에 대한 맥락 함축(contextual implication)으로 나타내는 화용론적 기능을 담당하는 담화 연결표현이라고 주장하고자 한다. 영어의 'so'가 'therefore', 'thus', 'hence' 등과 구별되고, 그 기준이 적합성 원리에 의해 설명될 수 있듯이, 우리말의 '그러니까' 역시 '그래서', '그러므로' '그러니' 등과 구별되며, 그 차이점이 적합성 원리로 설명될 수 있다는 점을 보일 것이다. 더 나아가서, 현대 한국어의 여타 접속어미에도 본고에서와 같은 새로운 관점 또는 이론의 틀로써 잘 설명될 수 있는 현상이 존재하는지의 여부를 폭넓고 정밀하게 분석 연구하는 일이 요구된다는 점을 나타내고자 한다.편 어류에 함유된 유기주석화합물의 비율을 볼 때, BT 화합물의 경우 MBT 비율이 높게 나타난 반면 PT 화합물에서는 TPT 비율이 높게 나타났다. 전체적으로 볼 때 구룡포항에서 수획한 어패류의 유기주석화합물 농도는 국내 다른 항구의 어패류보다 높지 않은 것으로 나타났다.${\lrcorner}$ 내는 경우가 더 많았으며(75.4%), 남 여 대학생간 에는 고도로 통계적 유의성(p<0.001)이 인정되었다. 4. 음식선택 배경은 ${\ulcorner}$자신${\lrcorner}$이 결정하는 경우가 가장 많았고(52.1%), 선호하는 음식은 치킨, 햄버거, 피자 순이었으며, 남 여 대학생간에는 고도로 통계적 유의차(p<0.001)가 있었다. 즐기는 음료로는 ${\ulcorner}$콜라${\lrcorner}$가 가장 많았으며(46.8%), 그 다음은 사이다, 주스 등의 순으로 나타났으나, 남 여 대학생간에는 유의성있는 차이는 없었다. 음식의 먹는 시기는 점심과 저녁사이의 ${\ulcorner}$간식${\lrcorner}$이 가장 많았으며(42.2%), 남 여 대학생간에는 유의한 차이는 없었다. 패스트푸드는 많은 사람들이 ${\ulcorner}$${\lrcorner}$이 좋기 때문에 이용하며(62.8%), 남 여 대학생간에는 통계적 유의성(p<0.05)이 인정되었다. 5. ${\ulcorner}$입맛의 서구화(36.4%)와 외식을 선호(29.1%)${\lrcorner}$ 하기 때문에 패스트푸드를 이용하게 된 것으로 응답 하였으며, 남 여 대학생

  • PDF

AI 어시스턴트 플랫폼의 한국어와 중국어 음악청취 요청문 패턴구축 비교 연구 (A Comparative Study on Building Korean & Chinese Music Request Sentence Patterns for AI Assistant Platforms)

  • 윤소은;이가빈;남지순
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2020년도 제32회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.383-388
    • /
    • 2020
  • 본 연구에서는 AI 어시스턴트의 음악청취 도메인 내 요청문을 인식 및 처리하기 위해 한국어와 중국어를 중심으로 도메인 사전 및 패턴문법 언어자원을 구축하고 그 결과를 비교분석 하였다. 이를 통해 향후 다국어 언어자원 구축의 접근 방법을 모색할 수 있으며, 궁극적으로 패턴 기반 문법으로 기술한 언어자원을 요청문 인식에 직접 활용하고 또한 주석코퍼스 생성을 통해 기계학습 성능 향상에 도움을 줄 수 있을 것으로 기대된다. 본 연구에서는 우선 패턴문법의 구체적인 양상을 살펴보기에 앞서, 해당 도메인의 요청문 유형의 카테고리를 결정하는 과정을 거쳤다. 이를 기반으로 한국어와 중국어 요청문의 실현 양상과 패턴유형을 LGG 프레임으로 구조화한 후, 한국어와 중국어 패턴문법 간의 통사적, 형태적, 어휘적 차이점을 비교분석 하여 음악청취 도메인 요청문의 언어별 생성 구조 차이점을 관찰할 수 있었다. 구축한 패턴문법은 개체명을 변수(X)로 설정하는 경우, 한국어에서는 약 2,600,600개, 중국어에서는 약 11,195,600개의 표현을 인식할 수 있었다. 결과적으로 본 연구에서 제안한 언어자원의 언어별 차이에 대한 통찰을 통해 다국어 차원의 요청문 인식 자원과 기계학습 데이터로서의 효용을 확인하였다.

  • PDF