• 제목/요약/키워드: 번역어

검색결과 263건 처리시간 0.037초

한영 자동 번역을 위한 동사구 번역패턴의 활용 (Design of Verb-Phrase Patterns for Korean-to-English MT)

  • 양성일;김영길;서영애;김창현;홍문표;최승권
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2001년도 가을 학술발표논문집 Vol.28 No.2 (2)
    • /
    • pp.178-180
    • /
    • 2001
  • 원시언어 문장의 구조 분석을 기반으로 하는 기계번역 시스템에서 원시언어의 최소 의미 단위는 동사를 중심으로 한 단문으로 생각할 수 있다. 단문 단위 대역어를 지정하기 위해서는 동사구 번역패턴의 사용이 요구된다. 본 논문에서는 한국어 단문 내 격 정보와 번역을 위한 의미 제약조건을 기술하여 한영 기계번역 시스템에서 사용하는 동사구 번역패턴을 정의하고, 문장 정규화를 통한 동사구 번역패턴의 활용방법을 제안한다. 동사구 번역패턴은 단문 구조 파악을 위한 제약 조건부와 대역어 선정부로 나뉜다. 제약 조건부는 단문 구조 번역을 위한 최소한의 의미 제약만으로 기술되며, 격조사로 구분되는 격 정보를 갖는다. 이러한 격 정보는 원시언어인 한국어의 단문 분석을 위해 사용되며 분석결과에 대해 단문 단위 대역어를 지정한다. 동사구 번역 패턴은 실제 말뭉치에서의 사용을 반영하기 위해 병렬 말뭉치로부터 구축되며 실험을 통해 예측되는 패턴의 규모를 알아볼 수 있다.

  • PDF

한일 양국어 연결어미의 비교연구 - 일한 번역기에서 ${\sim}$[-아/-고]의 애매성 해소를 통하여 - (A Study on the Korean and Japanese Connective Endings)

  • 허남원;정유진;문경희;이종혁
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1998년도 제10회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.153-158
    • /
    • 1998
  • 본 논문에서는 한일 양국어의 연결어미에 관한 문법적 연구결과를 이용하여 효율적인 연결어미 번역방법을 제안한다. 특히, 일본어 연결어미 가운데서 가장 빈번히 사용되고 있으나 한국어로 기계번역할 경우 심각한 중의성을 보여온 [-아/-고]를 이에 상응하는 대표적 한국어 연결어미 [아/-고] 와 문법적 차원에서 비교 분석하여 자연스럽게 번역하는 방법을 제안한다. 기존의 일한기계번역 시스템에서는 일본어 연결어미 [-아/-고]의 한국어 번역 정확률이 약 54% 정도에 불과하였으나 제안하는 번역방법을 적용하면 73% 이상으로 개선됨을 보인다.

  • PDF

더 좋은 인코더 표현을 위한 뇌 동기화 모방 이중 번역 (Dual Translation Imitating Brain-To-Brain Coupling for Better Encoder Representations)

  • 최규현;김선훈;장헌석;강인호
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2019년도 제31회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.333-338
    • /
    • 2019
  • 인코더-디코더(Encoder-decoder)는 현대 기계 번역(Machine translation)의 가장 기본이 되는 모델이다. 인코딩은 마치 인간의 뇌가 출발어(Source language) 문장을 읽고 이해를 하는 과정과 유사하고, 디코딩은 뇌가 이해한 의미를 상응하는 도착어(Target language) 문장으로 재구성하는 행위와 비슷하다. 그렇다면 벡터로 된 인코더 표현은 문장을 읽고 이해함으로써 변화된 뇌의 상태에 해당한다고 볼 수 있다. 사람이 어떤 문장을 잘 번역하기 위해서는 그 문장에 대한 이해가 뒷받침되어야 하는 것처럼, 기계 역시 원 문장이 가진 의미를 제대로 인코딩해야 향상된 성능의 번역이 가능할 것이다. 본 논문에서는 뇌과학에서 뇌 동기화(Brain-to-brain coupling)라 일컫는 현상을 모방해, 출발어와 도착어의 공통된 의미를 인코딩하여 기계 번역 성능 향상에 도움을 줄 수 있는 이중 번역 기법을 소개한다.

  • PDF

영한 기계번역에서의 복합어구 인식 (Complex Phrase Recognition in English-to-Korean Machine Translation : MATES/EK)

  • 장두성;김덕봉;최기선
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1992년도 제4회 한글 및 한국어정보처리 학술대회
    • /
    • pp.503-510
    • /
    • 1992
  • 복합어는 여러개의 단어가 하나의 의미론 나타내는 단어를 말한다. 이 논문에서는 번역시 구성단어들의 의미의 합이 아닌 다른 또 하나의 의미를 나타내는 단어를 대상으로 한다. 이러한 복합어는 구문해석 단계에서 많은 애매성의 원인이 되며, 유형에 따라 숙어 처럼 새로운 의미로 항상 같이 쓰이는 복합어와 복합어의 형성이 복잡하여 규칙으로서 단어를 이해할 필요가 있는 단어로 구분할 수 있다. 첫번째 유형은 단어의 형성이 단순하여 하나의 사전 엔트리로 등록될 수 있다. 이때 이들 복합어가 가지는 개별 어휘 규칙을 같이 사전에 등록하여 사전을 효과적 이용할 수 있다. 두번째 유형은 규칙에 의한 처리를 하여야 한다. 이러한 복합어에 대한 인식을 구문분석이전에 행함으로서 적은 노력으로 복합어로 인한 전체 문장의 애매성을 감소시키고, 문장내 단어의 수를 감소시킴으로서 전채 번역시스템의 효율을 증대하며, 복합어의 처리는 번역문을 자연스럽게 생성하는 데 큰 효과를 나타낸다.

  • PDF

한일 기계변역에서 일본어 술부생성 (Japanese Predicate Generation in Korean-Japanese Machine Translation)

  • 곽종근;김은자;이종혁;이근배
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1994년도 제6회 한글 및 한국어정보처리 학술대회
    • /
    • pp.173-176
    • /
    • 1994
  • 서로 다른 언어를 사용하는 사람들 사이에 언어의 장벽을 넘기 위한 수단으로 컴퓨터를 이용한 기계번역이 각광 받고 있다. 본 논문에서는 한일 기계번역 시스템에서 한국어로부터 일본어를 생성하는 과정에서 고려해야 할 사항에 관해 다룬다. 일본어는 한국어와 문법적 특성이 거의 유사하여 기계번역의 방법 가운데 직접 번역 방식이 선호되고 있다. 그러나 일본어의 한 술부내의 문법형태소들은 한국어와 비교해 볼 때, 상이한 점이 많아서 다른 부분에 비해 자연스러운 생성이 어렵다. 본 논문에서는 한일 기계번역에서 일본어의 생성시 발생하는 문제점들을 해결할 수 있는 방안을 제시한다.

  • PDF

일한 기계번역 시스템 COBALT-J/K의 성능 평가 (Evaluation of COBALT-J/K, Japanese to Korean Machine Translation System)

  • 정중락;김정인;문경희;이종혁;이근배
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1996년도 제8회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.338-345
    • /
    • 1996
  • 일본어 특허 문서를 번역하기 위해 개발이 시작된 COBALT-J/K(COllocation - BAsed Language Translator from Japanese to Korea)는 현재 그 번역 대상을 모든 일본어 문서로 확장해 곧, 상용 시스템으로 전환을 바라보고 있다. 이런 시점에서 일반 문서를 대상으로 하는 범용 기계 번역 시스템의 관점에서 시스템을 평가하여 문제점을 찾고, COBALT-J/K가 우선적으로 해결하고자 한 문제들이 올바르게 해결되었는지를 살피고자 한다. 이를 위한 평가 방법으로 문형별로 분류된 다수의 일본어 문장에 대하여 실제 번역을 하여 한국어 번역문과 일본어 원문을 비교하는 방식으로 분석하였으며, 현재 시판되고 있는 J-Seoul에 대해서도 같은 방법으로 실험한 결과를 얻은 후, 이 결과는 평가의 보조 자료로 삼았다.

  • PDF

단어 수준 한국어-영어 기계번역 품질 예측 (Word-level Korean-English Quality Estimation)

  • 어수경;박찬준;서재형;문현석;임희석
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2021년도 제33회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.9-15
    • /
    • 2021
  • 기계번역 품질 예측 (Quality Estimation, QE)은 정답 문장에 대한 참조없이 소스 문장과 기계번역 결과를 통해 기계번역 결과에 대한 품질을 수준별 주석으로 나타내주는 태스크이며, 다양한 활용도가 있다는 점에서 꾸준히 연구가 수행되고 있다. 그러나 QE 모델 학습을 위한 데이터 구성 시 기계번역 결과에 대해 번역 전문가가 교정한 문장이 필요한데, 이를 제작하는 과정에서 상당한 인건비와 시간 비용이 발생하는 한계가 있다. 본 논문에서는 번역 전문가 없이 병렬 또는 단일 말뭉치와 기계번역기만을 활용하여 자동화된 방식으로 한국어-영어 합성 QE 데이터를 구축하며, 최초로 단어 수준의 한국어-영어 기계번역 결과 품질 예측 모델을 제작하였다. QE 모델 제작 시에는 Cross-lingual language model (XLM), XLM-RoBERTa (XLM-R), multilingual BART (mBART)와 같은 다언어모델들을 활용하여 비교 실험을 수행했다. 또한 기계번역 결과에 대한 품질 예측의 객관성을 검증하고자 구글, 아마존, 마이크로소프트, 시스트란의 번역기를 활용하여 모델 평가를 진행했다. 실험 결과 XLM-R을 활용하여 미세조정학습한 QE 모델이 가장 좋은 성능을 보였으며, 품질 예측의 객관성을 확보함으로써 QE의 다양한 장점들을 한국어-영어 기계번역에서도 활용할 수 있도록 했다.

  • PDF

벡터를 사용한 2단계 영한 대역어 선택 (2-Level English-Korean Target Word Selection Using Vectors)

  • 이기영;박상규
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2003년도 추계학술발표논문집 (상)
    • /
    • pp.473-476
    • /
    • 2003
  • 영한 자동번역 시스템에서 대역어 선택 모듈은 어휘 변환을 수행한다. 일반적으로 영어 단어는 다양한 한국어 단어로 번역될 수 있는 의미적 모호성을 지니고 있으며, 고품질의 영한 자동번역 결과를 제공하기 위해서는, 해당 문맥에 가장 적합한 한국어 단어가 선택되어야 한다. 본 논문에서는 영어의 명사 어휘에 대하여, 벡터를 사용하는 2 단계 영한 대역어 선택 기법을 제안한다. 벡터를 사용하는 2 단계 대역어 선택 방식은 첫 번째 단계에서, 원문에서 사용된 영어 명사의 의미를 결정하고, 두 번째 단계에서, 해당 의미를 지니는 유사 한국어 대역어 가운데, 생성될 한국어 문맥에 맞는 적합한 한국어 대역어를 선택한다. 또한 제안하는 방법의 타당성을 검증하기 위해 현재 우리가 개발중인 Tellus-EK 영한 자동번역 시스템에 적용한 결과를 논한다.

  • PDF

한국어 목적격조사의 몽골어 격 어미 번역 (Translation of Korean Object Case Markers to Mongolian's Suffixes)

  • ;신준철;옥철영
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제8권2호
    • /
    • pp.79-88
    • /
    • 2019
  • 최근 기계 번역에 관한 연구들이 활발하게 이루어지고 있고 한국어와 몽골어 간의 상호 기계 번역 시스템도 개발되고 있다. 한국어와 몽골어는 계통적으로 같은 어족에 속하며 '주어+목적어+서술어'라는 비교적 자유로운 어순을 가지는 언어이고 어미와 조사가 발달한 것이 그 특징이다. 따라서 기계 번역 시 양언어의 조사나 어미의 의미를 잘 번역하는 것이 중요하다. 그러나 한국어 목적격 조사를 몽골어로 번역할 때 한국어 목적격 조사가 몽골어의 여러 격 어미로 번역이 될 수 있는데, 기존의 연구들은 한 가지 격 어미로만 번역해 정확한 의미를 전달하지 못하는 문제점이 있다. 본 논문에서는 이러한 문제점을 개선하기 위하여 한국어 형태소 분석과 동시에 품사 및 동형이의어 태깅 시스템인 유태거(UTagger)를 기반으로 하여 한국어 목적격 조사의 몽골어 격 어미 결정 방법을 제안한다. 제안하는 방법에서는 한국어 목적격 조사에 대응하는 몽골어 격 어미들을 살펴보고 데이터 테이블을 설계하여 적절한 격 어미를 결정한다. 제안한 방법의 성능을 검증하기 위하여 한국어기초사전에서 데이터를 추출하고 유태거와 비교 실험하였다. 실험 결과 목적격 조사를 바로 대격 어미로 번역한 유태거의 정확률은 46.9%인데 반해 본 논문에서 제안한 방법은 88.38%로 제안한 방법이 41.48%p 더 우수한 결과를 보였다.

인접 단어들의 접속정보를 이용한 일한 활용어 번역 (Japanese-to-Korean Inflected Word Translation Using Connection Relations of Two Neighboring Words)

  • Kim, Jung-In;Lee, Kang-Hyuk
    • 인지과학
    • /
    • 제15권2호
    • /
    • pp.33-42
    • /
    • 2004
  • 일본어와 한국어는 문법적으로 많은 유사점을 가지고 있다. 이러한 유사점을 잘 이용한다면 일한 기계번역 시스템에서 구문해석이나 의미해석의 상당한 부분을 생략할 수 있다. 몇 년 전부터 우리는 유사성을 이용하여 번역율을 높이는 방법으로 번역테이블을 이용한 일한기계번역 시스템을 연구해왔다. 그러나 이 시스템은 활용어미의 번역, 다의성 단어의 처리 등 및 가지 문제점을 가지고 있었다. 본 논문에서는 번역데이블을 이용하는 시스템을 개선하여 이웃하는 단어들과의 관계 정보를 이용한 일한 기계번역 시스템을 제안한다. 현재 시스템의 문제점들을 해결하기 위하여 우선 조사, 조동사의 접속정보를 최대한 이용한다. 또한, 번역 테이블을 엔트리테이블과 접속정보 테이블로 나누어 설계하여 번역의 효율을 높인다. 즉, 하나의 역어만 가지는 단어인 경우, 우리는 일한 직접 대응 방법을 이용하여 바로 번역하고 2개 이상의 역어로 번역되어야 할 경우만 접속 정보 값을 평가하여 가장 가능성이 높은 번역어를 선택하도록 한다.

  • PDF