• 제목/요약/키워드: 정보공학 방법론

검색결과 788건 처리시간 0.025초

한중 기계번역 시스템을 위한 동사구 패턴 반자동 확장 방안 연구 (A Study on Semi-Automatic Construction of Verb Patterns for a Korean-Chinese MT System)

  • 홍문표;류철;김영길;박상규
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2003년도 제15회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.273-278
    • /
    • 2003
  • 본 논문에서는 한-중 기계번역 시스템에서 사용되는 한중 동사구 패턴의 반자동 생성을 위한 방법론을 제안한다. 한중 동사구 패턴은 한국어와 중국어간의 변환을 위한 정보를 제공할 뿐만 아니라, 한국어의 구문분석과 중국어의 생성을 위해 중요한 정보를 제공하는 고급 언어자원이다. 본 논문에서 제시하는 새로운 패턴 반자동확장 방안은 기존의 한중 동사구 패턴으로부터 대역어 정보를 이용하여 새로운 동사구 패턴을 생성해내는 방법이다. 본 방법론은 시스템 개발 초기에 일반적으로 이루어지는 사전기반 패턴 구축이 끝난 후, 패턴의 커버리지 문제를 해결하기 위해 실용적으로 적용할 수 있는 방법론으로서, 한국어와 중국어 같이 활용 가능한 대역 코퍼스가 아직 많지 않은 경우에 효과적이다. 본 논문에서 제시한 방법론은 실험 결과 67.15%의 정확률과 4.58배의 패턴 확장률을 나타냈다.

  • PDF

메타 정보를 활용한 프롬프트 기반 도메인 특화 한국어 관계 추출 (Domain-specific Korean Relation Extraction system using Prompt with Meta-Information)

  • 김진성;김경민;손준영;소아람;임희석
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2022년도 제34회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.369-373
    • /
    • 2022
  • 기존의 관계 추출 태스크에서의 많은 연구들은 사전학습 언어모델을 파인튜닝하여 뛰어난 성능을 달성해왔다. 하지만, 파인튜닝은 사전학습 시의 학습 기법과의 간극으로 인해 일반화 능력을 저해한다. 본 연구는 다운스트림 태스크를 사전학습의 Masked Language Modeling (MLM) 기법을 통해 해결하는 프롬프트 기반의 학습 기법을 활용하여, 특정 한국어 도메인에서의 관계 추출을 위한 프롬프트 기반 파인튜닝 방법론을 제안한다. 실험의 경우, 도메인의 특성이 뚜렷한 전통문화유산 말뭉치를 대상으로 실험을 진행하여 본 방법론의 도메인 적응력을 보이며, 메타 정보 즉, 개체 유형 및 관계 유형의 의미론적 정보를 일종의 지식 정보로 활용하여 프롬프트 기반 지식 주입의 효과성을 검증한다. 프롬프트에의 메타 정보의 주입과 함께 프롬프트 기반으로 파인튜닝된 모델은 오직 MLM 기법만을 이용하여 태스크를 수행하여 기존 파인튜닝 방법론 대비 파라미터 수가 적음에도, 성능 면에서 대부분 소폭 상승하는 경향을 보여줌으로써 그 효과성 및 효율성을 보인다.

  • PDF

설계정보 구축 및 재사용을 위한 지식베이스 시스템

  • 이수홍
    • 전산구조공학
    • /
    • 제8권4호
    • /
    • pp.4-16
    • /
    • 1995
  • 본 고에서는 지식베이스엔지니어링이 기존의 제품개발 방법론을 개선하기 위한 지능적인 설계도구로서 컴퓨터를 사용하는 새롭고 흥미로운 대안임을 살펴보았다. 전문가의 설계 및 현장 경험을 조직적이고 체계적으로 수집하여 활용하는 것은 동시공학(Concurrent Engineering) 방법론의 실행을 위한 도구로서 매우 중요함을 살펴보았다. 또한 시스템의 효과적인 구축을 위해 어떤한 것들을 고려해야 하는지도 살펴보았다. 이러한 일련의 과정을 통해 설계 분야가 미약한 국내 환경에 지식베이스엔지니어링이 하루 속히 정착되기를 희망한다.

  • PDF

광고 랜딩 페이지를 이용한 문맥 광고 시스템 (Contextual Advertising System using ad landing pages)

  • 이정현;하종우;정다운;이상근
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2010년도 추계학술발표대회
    • /
    • pp.62-64
    • /
    • 2010
  • 문맥 광고의 의미론적 매칭에서 웹 페이지와 광고의 매칭 정확도는 웹 페이지와 광고의 분류 성능에 종속적이다. 그러나 광고의 짧은 텍스트는 광고 분류 성능을 하락시키는 원인이 되고 있다. 본 논문에서는, 광고 분류 성능을 높이기 위하여, 광고 랜딩 페이지를 활용하여 광고 텍스트를 확장시키는 방법을 제안하고, 실험을 통하여 그 효과를 입증한다. 추가로, 구문론적 매칭과 의미론적 매칭 방법을 적용하여 개발된 문맥 광고 엔진의 프로토타입을 제시한다.

문틀기반 영한 자동번역 시스템 (Sentence-Frame based English-to-Korean Machine Translation)

  • 최승권;서광준;김영길;서영애;노윤형;이현근
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2000년도 제12회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.323-328
    • /
    • 2000
  • 국내에서 영한 자동번역 시스템을 1985 년부터 개발한 지 벌써 15년이 흐르고 있다. 15 년의 영한 자동번역 기술개발에도 불구하고 아직도 영한 자동번역 시스템의 번역품질은 40%를 넘지 못하고 있다. 이렇게 번역품질이 낮은 이유는 다음과 같이 요약할 수 있을 것이다. o 입력문에 대해 파싱할 때 오른쪽 경계를 잘못 인식함으로써 구조적 모호성의 발생문제: 예를 들어 등위 접속절에서 오른쪽 등위절이 등위 접속절에 포함되는 지의 모호성. o 번역 단위로써 전체 문장을 대상으로 한 번역패턴이 아닌 구나 절과 같은 부분적인 번역패턴으로 인한 문장 전체의 잘못된 번역 결과 발생. o 점차 증가하는 대용량 번역지식의 구축과 관련해 새로 구축되는 번역 지식과 기구축된 대용량 번역지식들 간의 상호 충돌로 인한 번역 품질의 저하. 이러한 심각한 원인들을 극복하기 위해 본 논문에서는 문틀에 기반한 새로운 영한 자동번역 방법론을 소개하고자 한다. 이 문틀에 기반한 영한 자동번역 방법론은 현재 CNN뉴스 방송 자막을 대상으로 한 영한 자동번역 시스템에서 실제 활용되고 있다. 이 방법론은 기본적으로 data-driven 방법론에 속하다. 문틀 기반 자동번역 방법론은 규칙기반 자동번역 방법론보다는 낮은 단계에서 예제 기반 자동번역 방법론보다는 높은 단계에서 번역을 하는 번역방법론이다. 이 방법론은 영한 자동번역에 뿐만 아니라 다른 언어쌍에서의 번역에도 적용할 수 있을 것이다.

  • PDF

큰 규모 소프트웨어의 개발을 위한 모델링 기법의 방향성에 대한 연구 (A Study on the Direction of Modeling Techniques for the Development of Large Scale Software)

  • 조민호
    • 한국전자통신학회논문지
    • /
    • 제15권1호
    • /
    • pp.167-172
    • /
    • 2020
  • 큰 규모의 소프트웨어 개발에서 모델링의 중요성은 이미 확인된 사항이다. 그리고 대부분의 프로젝트에서 모델링은 UML을 활용하여 수행되고 있다. 하지만 UML은 클래스를 중심으로 설계된 모델링 도구로서 공통모듈이나 컴포넌트, 프로세스 그리고 데이터의 모델링을 수행하기에는 복잡하고 기능이 부족하다. 이런 점을 보완하고자 컴퓨터 분야에서 개발되었던 구조적 방법론, 정보공학 방법론을 포함한 다양한 모델링 기법을 통합해서 사용하는 방안을 제시함으로써 실제 산업 현장에 도움이 되고자 한다. 이번 논문을 통하여 고객이 만족하는 소프트웨어의 개발을 위해서는 UML만 사용하지 않고 다양한 방법론의 기법을 사용하는 것이 유용함을 보이고자 한다.

MLM 기반 언어 간 전이학습을 이용한 개체명 인식 방법론 분석 (An Analysis of Named Entity Recognition System using MLM-based Language Transfer Learning)

  • 손준영;김경민;김진성;허윤아;임희석
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2022년도 제34회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.284-288
    • /
    • 2022
  • 최근 다양한 언어모델의 구축 및 발전으로 개체명 인식 시스템의 성능은 최고 수준에 도달했다. 하지만 이와 관련된 대부분의 연구는 데이터가 충분한 언어에 대해서만 다루기 때문에, 양질의 지도학습 데이터의 존재를 가정한다. 대부분의 언어에서는 개체 유형에 대한 언어의 잠재적 특성을 충분히 학습할 수 있는 지도학습 데이터가 부족하기 때문에, 종종 자원 부족의 어려움에 직면한다. 본 논문에서는 Masked language modeling 기반 언어 간 전이학습을 이용한 개체명 인식 방법론에 대한 분석을 수행한다. 이를 위해 전이를 수행하는 소스 언어는 고자원 언어로 가정하며, 전이를 받는 타겟 언어는 저자원 언어로 가정한다. 본 논문에서는 언어모델의 토큰 사전에 언어 독립적인 가상의 자질인 개체 유형에 대한 프롬프트 토큰을 추가하고 이를 소스 언어로 학습한 뒤, 타겟 언어로 전이하는 상황에서 제안하는 방법론에 대한 평가를 수행한다. 실험 결과, 제안하는 방법론은 일반적인 미세조정 방법론보다 높은 성능을 보였으며, 한국어에서 가장 큰 영향을 받은 타겟 언어는 네덜란드어, 한국어로 전이할 때 가장 큰 영향을 준 소스 언어는 중국어인 결과를 보였다.

  • PDF

비디오 스크립트를 이용한 문법적 패턴 습득 모델링 (Modelling Grammatical Pattern Acquisition using Video Scripts)

  • 석호식;장병탁
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2010년도 제22회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.127-129
    • /
    • 2010
  • 본 논문에서는 다양한 코퍼스를 통해 언어를 학습하는 과정을 모델링하여 무감독학습(Unsupervised learning)으로 문법적 패턴을 습득하는 방법론을 소개한다. 제안 방법에서는 적은 수의 특성 조합으로 잠재적 패턴의 부분만을 표현한 후 표현된 규칙을 조합하여 유의미한 문법적 패턴을 탐색한다. 본 논문에서 제안한 방법은 베이지만 추론(Bayesian Inference)과 MCMC (Markov Chain Mote Carlo) 샘플링에 기반하여 특성 조합을 유의미한 문법적 패턴으로 정제하는 방법으로, 랜덤하이퍼그래프(Random Hypergraph) 모델을 이용하여 많은 수의 하이퍼에지를 생성한 후 생성된 하이퍼에지의 가중치를 조정하여 유의미한 문법적 패턴을 탈색하는 방법론이다. 우리는 본 논문에서 유아용 비디오의 스크립트를 이용하여 다양한 유아용 비디오 스크립트에서 문법적 패턴을 습득하는 방법론을 소개한다.

  • PDF

Dempster's Rule of Combination을 이용한 인공신경망간의 결합에 의한 ARMA 모형화 (Combining Multiple Neural Networks by Dempster's Rule of Combination for ARMA Model Identification)

  • 오상봉
    • 정보기술응용연구
    • /
    • 제1권3_4호
    • /
    • pp.69-90
    • /
    • 1999
  • 본 논문은 시계열자료의 ARMA 모형화를 위해 계층적(Hierarchical) 문제해결 방식인 인공신경망 기초 의상결정트리분류기상의 인공신경망 구조를 개선하여 지역문제(Local Problem)를 해결하는 복수개의 인공신경망 결과를 Dempster's rule of combination을 이용하여 종합하는 병행적인 (Parallel) ARMA 모형활르 위한 방법론을 제시함으로써 의사결정트리분류기에 근거한 방법론의 단점을 보완하였다. 본 논문에서 제시한 ARMA 모형화를 위한 방법론은 세 단계로 구성되어 있다: 1) ESACF 특성 벡터 추출단계; 2) 개별 인공신경망에 의한 부분적 모델링 단계; 3) Conflict Resolution 단계, 제시한 방법론을 검증하기 위해 모의실험용 자료와 실제 시계열자료를 이용하여 제시된 방법론을 검증하였으며 실험결과 기존 연구에 비해 ARMA 모형화와 정확도가 높은 것으로 나타났다.

  • PDF

제품계열 공학의 핵심자산과 어플리케이션간의 Gap 분석 기법 (A Technique for Analyzing the Gap between in Product Line Engineering Core Asset and Applications)

  • 오상헌;김수동;류성열
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 가을 학술발표논문집 Vol.31 No.2 (2)
    • /
    • pp.322-324
    • /
    • 2004
  • PLE 방법론은 단일 제품이 아니라 유사한 제품들간의 공통성(Commonality)과 가변성(Variability)을 개발하고 관리하며 소프트웨어 개발 전체 생명주기에 걸쳐 부품을 조립하는 형태로 만들어진다. 또한 PLE 방법론은 재사용 단위가 가장 큰 방법론이기 때문에 최근에는 소프트웨어 업계에서 주목을 많이 받고 있다. 따라서 소프트웨어 재사용 분야가 점점 다양화되면서 어플리케이션의 특성에 적합한 프로세스에 대한 요구가 늘어나고 있다. 어플리케이션 과정은 요구사항 정의에 따라서 설계가 되어야 하고 이렇게 설계가 된 요구사항 정의와 핵심자산의 Gap 분석을 통해 정제된 설계를 얻을 수 있다. 하지만, 현재는 체계적인 절차와 기법에 대한 연구가 많이 미흡한 상태이다. 이렇게 체계적인 절차와 기법이 있다면 어플리케이션을 개발하는데 있어 보다 효율적이고, 보다 완성도 높은 어플리케이션이 개발 될 것이라고 기대한다. 따라서 본 논문에서는 제품계열공학의 핵심자산과 어플리케이션간의 Gap 분석 절차를 제안하고자 한다.

  • PDF