• 제목/요약/키워드: 모델 기준

검색결과 4,602건 처리시간 0.032초

대화 요약 생성을 위한 한국어 방송 대본 데이터셋 (KMSS: Korean Media Script Dataset for Dialogue Summarization )

  • 김봉수;전혜진;전현규;정혜인;장정훈
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2022년도 제34회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.198-204
    • /
    • 2022
  • 대화 요약은 다중 발화자와 발화문으로 이루어진 멀티턴 형식의 문서에 대해 핵심내용을 추출하거나 생성하는 태스크이다. 대화 요약 모델은 추천, 대화 시스템 등에 콘텐츠, 서비스 기록에 대한 분석을 제공하는 데 유용하다. 하지만 모델 구축에 필요한 한국어 대화 요약 데이터셋에 대한 연구는 부족한 실정이다. 본 논문에서는 생성 기반 대화 요약을 위한 데이터셋을 제안한다. 이를 위해 국내 방송사의 대용량 콘텐츠로 부터 원천 데이터를 수집하고, 주석자가 수작업으로 레이블링 하였다. 구축된 데이터셋 규모는 6개 카테고리에 대해 약 100K이며, 요약문은 단문장, 세문장, 2할문장으로 구분되어 레이블링 되었다. 또한 본 논문에서는 데이터의 특성을 내재화하고 통제할 수 있도록 대화 요약 레이블링 가이드를 제안한다. 이를 기준으로 모델 적합성 검증에 사용될 디코딩 모델 구조를 선정한다. 실험을 통해 구축된 데이터의 몇가지 특성을 조명하고, 후속 연구를 위한 벤치마크 성능을 제시한다. 데이터와 모델은 aihub.or.kr에 배포 되었다.

  • PDF

한국어 오픈 도메인 대화 모델의 CTRL을 활용한 혐오 표현 생성 완화 (Mitigating Hate Speech in Korean Open-domain Chatbot using CTRL)

  • 좌승연;차영록;한문수;신동훈
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2021년도 제33회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.365-370
    • /
    • 2021
  • 대형 코퍼스로 학습한 언어 모델은 코퍼스 안의 사회적 편견이나 혐오 표현까지 학습한다. 본 연구에서는 한국어 오픈 도메인 대화 모델에서 혐오 표현 생성을 완화하는 방법을 제시한다. Seq2seq 구조인 BART [1]를 기반으로 하여 컨트롤 코드을 추가해 혐오 표현 생성 조절을 수행하였다. 컨트롤 코드를 사용하지 않은 기준 모델(Baseline)과 비교한 결과, 컨트롤 코드를 추가해 학습한 모델에서 혐오 표현 생성이 완화되었고 대화 품질에도 변화가 없음을 확인하였다.

  • PDF

ELECTRA 기반 순차적 문장 분류 모델 (Sequential Sentence Classification Model based on ELECTRA)

  • 최기현;김학수;양성영;정재홍;임태구;김종훈;박찬규
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2020년도 제32회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.327-330
    • /
    • 2020
  • 순차적 문장 분류는 여러 문장들을 입력으로 받아 각 문장들에 대하여 사전 정의된 라벨을 할당하는 작업을 말한다. 일반적인 문장 분류와 대조적으로 기준 문장과 주변 문장 사이의 문맥 정보가 분류에 큰 영향을 준다. 따라서 입력 문장들 사이의 문맥 정보를 반영하는 과정이 필수적이다. 최근, 사전 학습 기반 언어 모델의 등장 이후 여러 자연 언어 처리 작업에서 큰 성능 향상이 있었다. 앞서 언급하였던 순차적 문장 분류 작업의 특성상 문맥 정보를 반영한 언어 표현을 생성하는 사전 학습 기반 언어 모델은 해당 작업에 매우 적합하다는 가설을 바탕으로 ELECTRA 기반 순차적 분류 모델을 제안하였다. PUBMED-RCT 데이터 셋을 사용하여 실험한 결과 제안 모델이 93.3%p로 가장 높은 성능을 보였다.

  • PDF

HR-평가 문장 Multi-classification 및 Unlabeled data 를 활용한 Post-training 효과 분석 (HR-evaluation sentence multi-classification and Analysis post-training effect using unlabeled data)

  • 최철;임희석
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2022년도 춘계학술발표대회
    • /
    • pp.424-427
    • /
    • 2022
  • 본 연구는 도메인 특성이 강한 HR 평가문장을 BERT PLM 모델을통해 4 가지 class 로 구분하는 문제를 다룬다. 다양한 PLM 모델 적용과 training data 수에 따른 모델 성능 비교를 통해 특정 도메인에 언어모델을 적용하기 위해서 필요한 기준을 확인하였다. 또한 Unlabeled 된 HR 분야 corpus 를 활용하여 BERT 모델을 post-training 한 HR-BERT 가 PLM 분석모델 정확도 향상에 미치는 결과를 탐구한다. 위와 같은 연구를 통해 HR 이 가지고 있는 가장 큰 text data 에 대한 활용 기반을 마련하고, 특수한 도메인 분야에 PLM 을 적용하기 위한 가이드를 제시하고자 한다

대규모 언어모델의 한국어 이해 능력 평가 방법에 관한 연구 (A Study on the Evaluation Method of Korean Comprehension Abilities of Large Language Model)

  • 손기준;김승현
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2024년도 춘계학술발표대회
    • /
    • pp.733-736
    • /
    • 2024
  • 최근 GTP4, LLama와 같은 초거대 언어모델을 활용한 서비스가 공개되어 많은 사람의 주목을 받고 있다. 해당 모델들은 사용자들의 다양한 질문에 대하여 유창한 결과를 생성하고 있지만 한국어 데이터에 대한 학습량이 부족하여 한국어 이해 및 한국 문화 등에 대한 잘못된 정보를 제공하는 문제를 야기할 수 있다. 이에 본 논문에서는 한국어 데이터를 학습한 주요 공개 모델 6개를 선정하고 5개 분야(한국어 이해 및 문화 영역으로 구성)에 대한 평가 데이터셋을 구성하여 한국어 이해 능력에 대한 평가를 진행하였다. 그 결과 한국어 구사 능력은 Bookworm 모델이, 한국어 이해 및 문화와 관련한 부문은 LDCC-SOLAR 모델이 우수한 것으로 확인할 수 있었다.

최신 중력 자료의 획득을 통한 우리나라 지오이드 모델 업데이트 (The Update of Korean Geoid Model based on Newly Obtained Gravity Data)

  • 이지선;권재현;금영민;문지영
    • 한국측량학회지
    • /
    • 제29권1호
    • /
    • pp.81-89
    • /
    • 2011
  • 기존의 우리나라의 지상중력 자료는 지역적으로 편향된 분포를 나타내며, 특히 산악지역에서는 그 분포가 현저히 떨어진다는 문제점이 존재하였다. 이러한 문제점은 GPS/Levelling 자료에서도 나타나며 이로 인하여 지오이드 정확도 향상에 한계가 있었다. 그러나 2008년부터 국토지리정보원에서 수행하고 있는 통합기준점 및 수준점 중력측량사업에서 새로운 중력 자료 및 GPS/Levelling 자료를 획득하였으며, 특히 이러한 자료들은 기존의 중력 및 GPS/Levelling 자료에 비해 월등한 분포와 정밀도를 나타내기 때문에 우리나라 지오이드 모델의 정밀도를 개선하는 기본 자료로 활용될 수 있다. 본 연구에서는 품질이 검증된 기존 자료와 새롭게 획득된 중력 자료를 포함하여 지오이드 모델을 구축하였다. 구축된 지오이드 모델의 정밀도는 새롭게 획득된 927점의 GPS/Levelling 자료와 비교한 결과 약 5.29cm로 나타났으며, 합성지오이드의 적합도 및 정밀도는 각각 약 2.99cm와 3.67cm로 산출되었다. 본 연구를 통하여 산출된 최신 지오이드 모델은 새로운 중력 자료를 포함하기 전에 구축된 모델에 비하여 우리나라 전역에서 약 27% 정도 정밀도가 향상되었으며, 특히 현저히 낮은 분포를 보이던 강원 및 경상지역에서는 중력자료의 업데이트에 의하여 약 42%의 정밀도 향상이 이루어 졌다. 2010년에 통합기준점 사업 및 수준점 측량사업을 통하여 약 4,000여점의 중력 자료와 300여점의 GPS/Levelling 자료가 획득되었기 때문에 향후 본 자료들을 함께 활용한다면 지오이드 모델 정밀도의 향상과 더불어 객관적으로 정밀도 검증이 가능할 것으로 판단된다.

소프트웨어 제품 계열 공학의 온톨로지 기반 휘처 공동성 및 가변성 분석 기법 (Ontology-based Approach to Analyzing Commonality and Variability of Features in the Software Product Line Engineering)

  • 이순복;김진우;송치양;김영갑;권주흠;이태웅;김현석;백두권
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제34권3호
    • /
    • pp.196-211
    • /
    • 2007
  • 제품 계열 공학에서 제품의 공통성 및 가변성 분석을 결정짓게 하는 기준인 휘처 (feature) 분석에 대한 기존 연구는 개발자의 직관이나 도메인 전문가의 경험에 근간으로 분석 기준이 객관적이지 못하며, 비정형적인 휘처 분석으로 인한 이해 당사자 (stakeholder)의 공통된 휘처의 이해 부족 및 불명확한 휘처를 추출하는 문제점이 있었고, 기 개발된 소프트웨어에서 사용된 휘처의 재사용 개념이 부족했었다. 본 논문에서는 특정 도메인의 휘처 모델을 온톨로지로 변환하여 의미 기반 유사성 분석 기준에 의해 휘처의 공통성과 가변성을 추출하는 기법을 제시한다. 이를 위해, 먼저 공통된 휘처 중심의 메타 휘처 모델 기반으로 휘처의 속성을 정립하고, 메타 모텔에 준거하여 휘처 모델을 생성하여 온톨로지로 변환 후, 휘처 온톨로지 리포지토리 (Repository)에 저장한다. 이후, 동일 제품 계열 도메인의 휘처 모델 구축 시, 기 존 생성 모델과 온톨로지의 의미 기반 유사성 비교 분석 기법을 통해 휘처의 공통성과 가변성을 추출하는 것이다 또한 유사성 비교 알고리즘을 툴로 구현하였으며, 전자 결재 시스템 도메인의 실험 및 평가를 통 해 효과성을 보인다. 본 기법을 통해 메타 휘처 모델의 구문적 정립으로 이해성과 정확성을 제고시켜 고품질의 휘처 모델을 구축할 수 있으며, 온톨로지의 의미 기반 매핑으로 휘처의 공통성 및 가변성 추출을 정형화할 수 있고, 재사용성을 향상시킬 수 있다.

DSR 환경에서의 다 모델 음성 인식시스템의 성능 향상 방법에 관한 연구 (A Study on Performance Improvement Method for the Multi-Model Speech Recognition System in the DSR Environment)

  • 장현백;정용주
    • 융합신호처리학회논문지
    • /
    • 제11권2호
    • /
    • pp.137-142
    • /
    • 2010
  • 다 모델 음성인식기는 잡음환경에서 매우 우수한 성능을 보이는 것으로 평가되고 있다. 그러나 지금까지 다 모델 기반인식기의 성능시험에는 잡음에 대한 적응을 고려하지 않은 일반적인 전처리 방식이 주로 활용하였다. 본 논문에서는 보다 정확한 다 모델 기반인식기에 대한 성능 평가를 위해서 잡음에 대한 강인성이 충분히 고려된 전처리 방식을 채택하였다. 채택된 전처리 알고리듬은 ETSI (European Telecommunications Standards Institute)에서 DSR (Distributed Speech Recognition) 잡음환경을 위해서 제안된 AFE (Advanced Front-End) 방식이며 성능비교를 위해서 DSR 환경에서 좋은 성능을 나타낸 것으로 알려진 MTR (Multi-Style Training)을 사용하였다. 또한, 본 논문에서는 다 모델 기반인식기의 구조를 개선하여 인식성능의 향상을 이루고자 하였다. 기존의 방식과 달리 잡음음성과 가장 가까운 N개의 기준 HMM을 사용하여 기준 HMM의 선택시에 발생할 수 있는 오류 및 잡음신호의 변이에 대한 대비를 하도록 하였으며 각각의 기준 HMM을 훈련을 위해서 다수의 SNR 값을 이용함으로서 구축된 음향모델의 강인성을 높일 수 있도록 하였다. Aurora 2 데이터베이스에 대한 인식실험결과 개선된 다 모델기반인식기는 기존의 방식에 비해서 보다 향상된 인식성능을 보임을 알 수 있었다.

연속지지 RC 깊은 보의 부정정 스트럿-타이 모델 및 하중분배율 (II) 적합성 평가 (Indeterminate Strut-Tie Model and Load Distribution Ratio of Continuous RC Deep Beams (II) Validity Evaluation)

  • 채현수;김병헌;윤영묵
    • 콘크리트학회논문집
    • /
    • 제23권1호
    • /
    • pp.13-22
    • /
    • 2011
  • 이 논문에서는 전편 논문에서 제안한 부정정 스트럿-타이 모델 및 하중분배율 결정식을 ACI 318M-08 스트럿-타이 모델 설계기준에 적용하여 파괴실험이 수행된 51개 연속지지 철근콘크리트 깊은 보의 극한강도를 평가하였다. 또한 연속 깊은 보의 극한강도를 실험식, 실험 및 이론 전단강도모델에 기초한 설계기준, 그리고 현 스트럿-타이 모델설계기준 등으로 평가하고, 그 결과를 이 연구의 방법에 의한 결과와 비교분석하여 이 연구에서 제안한 방법의 적합성을 검증하였다. 이 연구의 방법은 기존의 여러 방법에 비해 극한강도를 비교적 양호하게 평가하였으며, 또한 극한강도평가 시 연속 깊은 보의 강도 및 거동에 영향을 미치는 전단경간비, 콘크리트의 압축강도, 그리고 휨철근비 등 주요설계변수들의 영향을 기존 방법들에 비해 정확하고 일관성 있게 반영하였다. 따라서 이 연구의 방법은 부정정 스트럿-타이 모델 방법을 이용한 연속 깊은 보의 합리적이고 실용적인 설계를 가능하게 할 것으로 판단된다.

인공지능 모델에 의한 지하수위 모의결과의 적절성 판단을 위한 허용가능한 예측오차 범위의 추정 (Estimation of the allowable range of prediction errors to determine the adequacy of groundwater level simulation results by an artificial intelligence model)

  • 신문주;문수형;문덕철;류호윤;강경구
    • 한국수자원학회논문집
    • /
    • 제54권7호
    • /
    • pp.485-493
    • /
    • 2021
  • 지하수는 지표수와 함께 용수로 사용가능한 중요한 수자원이며 특히 섬 지역의 경우 전체 수자원 중 지하수의 이용 비율이 상대적으로 높기 때문에 안정적인 이용을 위해 지하수위 변동성에 대한 연구는 필수적이다. 지하수위 변동성의 예측 및 분석을 위해 인공지능 모델을 활용한 연구들이 지속적으로 증가하고 있으나 지하수위 예측결과의 적절성을 판단할 수 있는 평가기준을 제시한 연구는 충분하지 않다. 본 연구에서는 허용가능한 지하수위 예측오차의 범위를 제시하기 위해 과거 20년 동안 전 세계 다양한 지역을 대상으로 인공지능 모델을 활용하여 지하수위를 예측한 연구결과들을 종합적으로 분석하였다. 그 결과 관측지하수위의 변동성이 커질수록 인공지능 모델에 의한 지하수위 예측오차는 증가하였다. 따라서 관측지하수위 최대변동폭과 예측오차 간의 상관성과 기존 연구들에서 제시한 평가지수들을 고려하여 평가기준을 산정하였으며, 인공지능 모델에 의한 지하수위 예측결과의 적절한 평가기준은 도출된 선형회귀식에 의한 평균제곱근오차 또는 최대오차 이하이거나, NSE ≥ 0.849 또는 R2 ≥ 0.880 이다. 이 허용가능한 오차범위는 인공지능 모델을 활용한 지하수위 예측결과의 적절성 판단을 위한 참고자료로 사용할 수 있다.