Search | Korea Science

The Statistical Relationship between Linguistic Items and Corpus Size (코퍼스 빈도 정보 활용을 위한 적정 통계 모형 연구: 코퍼스 규모에 따른 타입/토큰의 함수관계 중심으로)

양경숙;박병선
- Language and Information
- /
- v.7 no.2
- /
- pp.103-115
- /
- 2003
In recent years, many organizations have been constructing their own large corpora to achieve corpus representativeness. However, there is no reliable guideline as to how large corpus resources should be compiled, especially for Korean corpora. In this study, we have contrived a new statistical model, ARIMA (Autoregressive Integrated Moving Average), for predicting the relationship between linguistic items (the number of types) and corpus size (the number of tokens), overcoming the major flaws of several previous researches on this issue. Finally, we shall illustrate that the ARIMA model presented is valid, accurate and very reliable. We are confident that this study can contribute to solving some inherent problems of corpus linguistics, such as corpus predictability, corpus representativeness and linguistic comprehensiveness.
PDF

Effective Passage Reranking with Textual Entailment Feedback (Textual Entailment Feedback 기반 효율적인 문서 재순위화기)

Seong-Uk Nam;Donghoon Han;Eunhwan Park;Seung-Hoon Na
- Annual Conference on Human and Language Technology
- /
- 2023.10a
- /
- pp.377-381
- /
- 2023
재순위화기 연구는 주로 파이프라인 과정 설계, 데이터 증강, 학습 함수 개선, 혹은 대규모 언어 모델의 지식 활용 등에 집중되어있다. 이러한 연구들은 좋은 성능 상승을 이끌어주었지만 실제 적용이 힘들 뿐만 아니라 학습 비용이 크게 발생한다는 한계점을 가지고 있다. 더 나아가 주어진 데이터 집합만을 활용해서는 보다 더 세부적인 학습 신호를 주기 어렵다는 단점 또한 존재한다. 최근 자연어처리 분야의 연구에서는 피드백을 인위적으로 생성하여 반영하여 모델 성능 상승을 이끄는 연구가 제안되었다. 본 연구는, 이러한 연구를 바탕으로 질의와 문서 간의 함의 관계 점수를 피드백으로 사용 및 재순위화기 모델로의 반영을 제안한다. 재순위화기 모델에 대해 피드백을 반영하는것은 그렇지 않은 모델 대비하여 성능 상승을 이끌며 피드백 반영이 더 좋은 표상 도출에 도움이 됨을 확인할 수 있다.
PDF

A Design and Implementation of Graphic Component for Function Learning in Mathematics (수학과 함수 학습을 위한 그래픽 컴포넌트 설계 및 구현)

Shin, Woo-Chang;Kim, Kap-Su
- The Journal of Korean Association of Computer Education
- /
- v.10 no.4
- /
- pp.51-59
- /
- 2007
There is the meager level of applying computers to mathematics education. It is because the effective mathematics educational softwares and the various contents that make students' spontaneous participation through the interaction with computers are insufficient. As a solution to solve it, we design and implement the graphic component, graphic entities and function types that are supported in the component was identified through analyzing the mid/high school curriculum, using a simple script language to invoke the functionality of the component improves reusability and extendability. The component can be used to produce the mathematics educational softwares and contents easily that need the facility to draw various functions and geometric figures.
PDF

Fuzzy-Neural Network Modeling of Nonlinear Systems using Genetic Algorithms (유전자 알고리즘을 이용한 비선형 시스템의 퍼지-신경 회로망 모델링)

이승형;최용준;김주웅;김한웅;김경수;엄기환
- Proceedings of the Korean Institute of Information and Commucation Sciences Conference
- /
- 1998.11a
- /
- pp.202-207
- /
- 1998
본 논문에서는 유전자 알고리즘을 이용하여 불확실한 비선형 시스템의 퍼지-신경 회로망 모델링을 제안하였다. 제안한 퍼지-신경 회로망 모델링을 위한 학습 알고리즘은 다음과 같은 세 단계로 나누어 진행한다. 첫 번째 단계에서는 퍼지 모델의 소속 함수의 중심간과 표준편차를 구하여 초기 퍼지소속 함수를 결정한다. 두 번째 단계에서는 새로운 알고리즘을 통하여 언어적 퍼지 규칙을 만든다. 마지막 세 번째 단계에서는 유전자 알고리즘을 이용하여 중심값과 표준편차를 최적화함으로써 퍼지 모델의 소속 함수를 조절한다. 제안된 유전자 알고리즘의 장점은 흔히 신경 회로망에서 널리 쓰이는 역전파 알고리즘이 갖는 지역 최소점에 빠지는 현상이 없다는 것이다. 제안한 알고리즘의 유용성을 확인하기 위하여 일반적으로 가장 많이 쓰이는 비선형 시스템에 대하여 시뮬레이션 하여 확인하였다.
PDF

Optimized Interval Type-2 Fuzzy Logic System by Means of Genetic Algorithms (유전자 알고리즘에 의한 최적 Interval Type-2 퍼지 논리 시스템)

Kim, Dae-Bok;Oh, Sung-Kwun;Kim, Hyun-Ki
- Proceedings of the KIEE Conference
- /
- 2008.07a
- /
- pp.1851-1852
- /
- 2008
Type-2 퍼지 논리 집합은 언어적인 불확실성을 다루기 위하여 고안된 Type-1 퍼지 논리 집합의 확장한 것이다. Type-2 퍼지 논리 시스템은 외부 노이즈를 효율적으로 다룰 수 있다. 본 논문에서는 불확실성을 표현하기 위해서 전.후반부 멤버쉽 함수로 삼각형 형태의 Type-2 퍼지 집합을 사용한다. 전반부 멤버쉽 함수의 정점을 결정하는데 유전자 알고리즘(Genetic Algorithms)으로 멤버쉽 함수의 정점을 결정한다. 제안된 모델은 모델 평가에 주로 사용되는 가스로 시계열 데이터를 적용하고, 테스트 데이터로 노이즈에 영향 받은 데이터를 사용하여 수치적인 예를 보인다.
PDF

Minimization of the Multi-Output Switching Function by using the Intersection Table and the Cost Table (교차표와 가격표를 이용한 다중출력 이론함수의 최소화)

황희융;김호겸;박영철;조동섭
- 전기의세계
- /
- v.28 no.12
- /
- pp.33-40
- /
- 1979
This mininzation of the multi-output switching function becomes a difficult task when the input varibles and the number of functions increase. This paper describes the optimal selection of prime inplicats for the multi-output switching function by using the Inter-section Table. This procedure is applicable to both manual and computhe programmed realization without complesith. The algorithm is implemented by a computer program in the standard FORTRAN iv language.
PDF

A Study for Program Slicing in the pressure of Function Calls (함수 호출이 존재하는 프로그램 슬라이싱에 관한 연구)

홍중기;강원임;박재홍
- Proceedings of the Korean Information Science Society Conference
- /
- 1999.10a
- /
- pp.560-562
- /
- 1999
프로그램 슬라이싱은 프로그램의 특정 위치에서 변수들의 값에 영향을 주는 문장을 추출하는 방법이다. 프로그램 슬라이싱의 유용성은 디버깅, 최적화, 프로그램 유지보수, 테스팅, 재사용 부품 추출 그리고 프로그램 이해를 포함하는 다른 응용 분야에 널리 알려져 있다. 본 논문은 C언어에서의 함수 호출이 존재하는 모듈간 프로그램 슬라이싱에 관한 연구이다. 기존의 모듈간 슬라이싱 알고리즘들은 함수의 호출 문맥 설명에 실패하거나 문장 기반 그래프를 사용함으로써 정확한 슬라이스 생성에 실패한다. 본 논문에서는 기존 방법들의 문제점을 지적하고, 시스템 정보 흐름 그래프 (System Information Flow Graph)를 이용하여 정확하고 수행 가능한 모듈간 슬라이스 생성 방법을 제안한다.
PDF

Typed Separation Set Partitioning for Thread Partitioning of Non-strict functional Programs (비평가인자 함수 프로그램의 스레드 분할 향상을 위한 자료형 분리 집합 분할알고리즘)

Yang, Chang-Mo;Joo, Hyung-Seok;Yoo, Weon-Hee
- The Transactions of the Korea Information Processing Society
- /
- v.5 no.8
- /
- pp.2127-2136
- /
- 1998
비평가인자 함수 언어는 비평가인자 어의로 인하여 기존의 von Neumann 형 병렬기에서 효율적인 수행을 어렵게 하는 미세수준의 동적 스케줄링 단위로 병합하는 과정이 중요하다. 이러한 과정을 스레드 분할이라 한다. 본 논문에서는 비평가인자 함수 프로그램을 스레드로 분할하는 자료형 분리집합 분할이라는 스레드 분할 알고리즘을 제안한다. 자료형 분리 집합 분할 알고리즘은 자료형을 비교할 수 없는 입력명과 출력명 사이에는 잠재 종속이 존재할 수 없다는 사실을 이용하여 스레드 분할을 수행한다. 이 방법을 사용하면 기존의 스레드 분할 방법에서 실패하는 스레드의 병합이 가능하며, 기존의 분할 알고리즘보다 더 큰 스레드를 생성할 수 있다.
PDF

Data Augmentation Strategy based on Token Cut-off for Using Triplet Loss in Unsupervised Contrastive Learning (비지도 대조 학습에서 삼중항 손실 함수 도입을 위한 토큰 컷오프 기반 데이터 증강 기법)

Myeongsoo Han;Yoo Hyun Jeong;Dong-Kyu Chae
- Annual Conference of KIPS
- /
- 2023.05a
- /
- pp.618-620
- /
- 2023
최근 자연어처리 분야에서 의미론적 유사성을 반영하기 위한 대조 학습 (contrastive learning) 관련 연구가 활발히 이뤄지고 있다. 이러한 대조 학습의 핵심은 의미론적으로 가까워져야 하는 쌍과 멀어져야 하는 쌍을 잘 구축하는 것이지만, 기존의 손실 함수는 문장의 상대적인 유사성을 풍부하게 반영하는데 한계가 있다. 이를 해결하기 위해, 이전 연구에서는 삼중 항 손실 함수 (triplet loss)를 도입하였으며, 본 논문에서는 이러한 삼중 항을 구성하기 위해 대조 학습에서의 효과적인 토큰 컷오프(cutoff) 데이터 증강 기법을 제안한다. BERT, RoBERTa 등 널리 활용되는 언어 모델을 이용한 실험을 통해 제안하는 방법의 우수한 성능을 보인다.
https://doi.org/10.3745/PKIPS.y2023m05a.618 인용 PDF

Experiments on Pseudo Relevance Feedback in Probabilistic Information Retrieval Model (확률적 정보 검색 모델에서의 유사 적합성 피드백 실험)

Cho, Bong-Hyun;Lee, Chang-Kee;An, Joo-Hui;Lee, Gary Geun-Bae
- Annual Conference on Human and Language Technology
- /
- 2001.10d
- /
- pp.183-190
- /
- 2001
본 논문은 확률기반 자연어 검색 시스템 POSNIR/E를 이용한 여러 가지 유사 적합성 피드백 방법들이 검색 시스템의 성능 향상에 기여할 수 있는 정도를 보여주고, 확률 기반 정보 검색 시스템에 적합한 유사 적합성 피드백 수행 방법을 제시한다. POSNIR/E는 한국어 자연어 검색 시스템, POSNIR를 기반으로 만들어진 영어 자연어 검색 시스템이다. 이 시스템은 성능 향상을 위한 질의 확장의 방법으로 검색 단계에서 유사 적합성 피드백을 사용한다. 검색 단계에서 영어 태거에 의해 태깅된 사용자 질의로부터 질의어를 추출하고 초기 검색을 수행한다. 유사 적합성 피드백을 위하여 초기 검색 결과 중 상위 5개의 문서에 나타나는 키워드를 중요도에 따라 내림차순 정렬하여 상위 10개의 키워드를 초기 질의어에 확장한다. 이렇게 확장된 질의어로 최종 검색을 수행한다. TREC 평가용 테스트 컬렉션 WT10g와 TREC-9의 질의 적합문서 집합을 이용하여 여러 가지 TSV 함수를 사용하여 검색 성능을 평가 하였다. 실험 결과 유사 적합성 피드백을 사용할 경우 TSV 함수에 확률 모델의 CF 요소 뿐만 아니라 TF 요소 등을 적용 시킬 경우 성능 향상에 기여할 수 있음을 알 수 있었다. 또한 색인어와 검색어로 단일어 뿐만 아니라 복합어도 사용할 경우 성능이 향상됨을 알 수 있다.
PDF

Search Result 367, Processing Time 0.041 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)