DOI QR코드

DOI QR Code

프롬프트 엔지니어링 기법을 활용한 LLM의 응답 안정성 및 일관성 향상에 관한 연구

Research on Improving Response Reliability and Consistency in LLM Using Prompt Engineering Techniques

  • 장민규 (경상국립대학교 컴퓨터공학과) ;
  • 최상민 (경상국립대학교 컴퓨터공학부)
  • Min-Gyu Jang (Dept. of Computer Sicence and Engineering, Gyeonsang National Univeristy) ;
  • Sang-Min Choi (Dept. of Computer Sicence and Engineering, Gyeonsang National Univeristy)
  • 투고 : 2025.09.08
  • 심사 : 2025.10.14
  • 발행 : 2025.10.31

초록

Large language models (LLMs) can exhibit reliability issues-most notably hallucinations-that undermine their suitability for high-stakes applications. We investigate a simple yet effective prompt-engineering strategy to improve response consistency and stability without modifying model internals. Our central technique prompts models to provide the reasoning evidence their answers, aiming for task-agnostic, broadly applicable gains in consistency. We compare two engineered prompt against one non-engineered baselines across three models (GPT-4o-mini, Llama-3.1-8B, and Gemini-2.0-Flash-Lite) and four datasets (BoolQ, QNLI, MRPC, SST-2). For every model-dataset-prompt combination, we run 10 trials and evaluate Accuracy, Precision, Recall, F1 score, and the standard deviation of F1. The engineered prompt yields the lowest F1 standard deviation across the full experimental suite, indicating markedly improved response stability; on several datasets, it also achieves substantial F1 gains over non-engineered prompts. These results suggest that explicitly requesting post-answer reasoning is a practical, cost-efficient, and broadly applicable method for reducing output variability and enhancing overall reliability in LLMs. Code: https://anonymous.4open.science/r/LLM_consitency-B0ED/README.md

키워드

1. 서론

최근 LLM(Large Language Models)은 수학 및 상식 추론과 QA(Question Answering)[1], 기계번역[2], 코드 생성[3], 지식 평가[4]와 같은 자연어 처리 과제에서 상당한 진전을 이루었다. SAT(Scholastic Aptitude Test), GRE(Graduate Record Examinations)와 종합 수학 능력 시험에서 높은 점수를 획득했고 전문 지식과 관련된 미변호사 시험, 미 의사 자격시험, 코딩 테스트 등 여러 영역에서 높은 성적을 기록하였다[5, 6, 7].

현재 구글, OpenAI, Perplexity 등과 같은 많은 서비스에서 이러한 LLM들을 API와 웹 인터페이스 형태의 Chatbot으로 제공하여 사용 접근성 또한 크게 향상시키고 있다. LLM의 성능과 접근성의 향상은 LLM을 검색엔진 외에 새로운 정보 탐색 도구로써 가능성을 열었다[10].

QA와 정보검색 과제의 유사성 때문에 사용자는 LLM을 질의응답뿐 아니라 검색 엔진의 대안으로 점점 더 사용하고 있다[10]. 두 과제 모두 입력된 질의를 기준으로 관련 정보를 선별해 결과를 제공하며 QA는 직접적인 답변을 정보 검색은 적합한 웹 페이지 혹은 문서 목록을 반환한다. 실제로 최근 조사에 따르면 상당수의 사용자가 개인 학습 및 정보 검색을 위해 LLM을 활용하고 있으며 연구자들 또한 LLM을 연구 프로세스에 통합하여 효율성을 높이고 있다[10, 11, 12].

LLM의 광범위한 활용과 그 중요성이 점차 증가하고 있음에도 불구하고 핵심적인 문제들은 여전히 남아있다. 사실이 아닌 정보를 마치 사실인 것 처럼 답변하는 환각(Hallucination)문제와 사전 학습된 정보에 의존하기 때문에 발생하는 최신 정보 반영의 어려움이라는 문제가 있다[13]. 이러한 문제들은 LLM의 신뢰성을 저하하고 사용자들이 LLM이 생성한 답변으로 인해 잘못된 결정을 내리는 피해로 이어질 수 있다. 또한 답변에 대한 검증 과정을 복잡하게 한다[13, 14]. 특히 사용자가 답변의 진위를 판단하기 어려운 경우, 교육, 법률, 의료 등 고신뢰가 요구되는 분야에서 심각한 영향을 미칠 수 있다[15].

기존에는 이와 같은 신뢰성과 일관성 문제를 해결하기 위해 모델 구조를 수정하거나 외부 정보 결합 방법인 RAG(RRetrieval-Augmented Generation)를 통해 보완하려는 시도가 주를 이루었다[16, 17, 18]. 하지만 이와 같은 접근은 도입과 유지 비용이 높고 특정 도메인에 국한되는 경우가 많아 범용적인 해결책으로 한계가 있다[19]. 이에 보다 단순하면서도 범용적인 방식으로 모델의 응답 일관성을 개선하는 방안이 필요하다. 각 방법론에 대한 한계는 Table 1과 같다.

Table 1. Limitations of Existing Methodologies

SOOOB6_2025_v28n5_2_1517_2_t0001.png 이미지

본 연구는 프롬프트 엔지니어링를 통해 모델에게 정답뿐만 아니라 그 이유까지 설명하도록 유도하는 방식이 모델 응답의 일관성과 성능을 향상 시킬 수 있는지 탐구한다. 널리 사용되는 모델인 Gemini, ChatGPT, Llama 모델들을 설계된 프롬프트와 이진 분류 자연어 과제 데이터셋인 BoolQ[20], QNLI(Question Natural Language Inference)[21], MRPC(Microsoft Research Paraphrase Corpus)[21], SST2(Standard Sentiment Treebank2)[21]을 이용하여 모델의 성능 측정과 성능에 대한 편차를 측정하여 성능과 일관성에 대한 탐구를 진행한다. 실험 결과, 본 연구의 방법론이 모델 및 데이터셋 간 성능의 표준편차가 가장 적게 나타났다. 이를 통해 안정적이고 일관된 응답 경향을 유도할 수 있음을 확인하였다. 이는 LLM의 안정성과 일관성을 향상 시키기 위한 단순하고 실용적인 방안이 될 수 있으며 특정 과제에 한정되지 않고 범용적으로 적용 가능한 방법이라는 점에서 의의를 둔다.

2. 제안 방식

제안하는 방식의 핵심은 Fig. 1과 같이 서로 다르게 설계된 3가지 유형의 프롬프트(Prompt-1, Prompt-2, Prompt-3)를 동일한 LLM에 입력하여 그 결과를 비교 분석하는 것이다. 구체적으로 Prompt-1은 본 논문의 프롬프트 엔지니어링이 적용되지 않은 프롬프트이며 Prompt-2는 답변과 답변 근거를 요구하는 프롬프트 엔지니어링이 적용되었다.

SOOOB6_2025_v28n5_2_1517_3_f0001.png 이미지

Fig. 1. Test Method per Prompt

Prompt-3은 Prompt-2와 동일한 프롬프트 엔지니어링이 적용되었지만 LLM의 정확성 향상을 위해 답변의 출력 형식을 다르게 설계하였다. 답변의 출력 형식은 Fig. 2의 Example에 포함되어 있으며 자세한 설명은 2.1.4에서 볼 수 있다. 각기 다른 프롬프트를 통해 생성된 답변(Result-1, Result-2, Result-3)을 수집한 후, 정량적 평가지표인 정확도(Accuarcy), 정밀도(Precision), 재현율(Recall), F1-Score, 표준편차를 활용하여 성능과 일관성을 측정한다[22]. 이 실험을 통해 어떤 유형의 프롬프트가 모델로부터 더 정확하고 일관된 답변을 유도하는지 확인한다.

SOOOB6_2025_v28n5_2_1517_3_f0002.png 이미지

Fig. 2. Proposed Prompt Structure

2.1 Prompt Engineering

프롬프트 엔지니어링은 LLM이 원하는 응답을 생성하도록 유도하기 위해 모델에 입력하는 지시문(프롬프트)을 설계하고 최적화하는 기법이다. 이는 모델 자체를 변경하지 않고 LLM의 성능을 향상시킬 수 있다[1]. 본 연구에서는 서로 다른 3가지 프롬프트 유형을 설계하여 실험에 활용하였다. 각 프롬프트는 동일한 구조로, System Role Prompt, Problem Prompt, Reasoning Prompt, Example(One-shot), Intstruction의 5가지 요소로 구성된다. 전체 구조는 Fig. 2에서 확인 가능하며 최종 Prompt 예시는 Table 2과 같다. 제안 프롬프트의 세부 사항은 2.1.1 System Role Prompt부터 2.2.5 Instruction까지 기술되어 있다.

Table 2. Example Prompts (Based on BoolQ)

SOOOB6_2025_v28n5_2_1517_4_t0001.png 이미지

2.1.1 System Role Prompt

System Role Prompt는 LLM에 특정 과제를 수행할 역할을 부여하는 프롬프트다. 본 연구의 모든 프롬프트에 공통적으로 “You are a system that answers a given question.” 라는 문구를 포함하여 모델이 주어진 질문에 답변하는 시스템으로서 역할을 수행하도록 정의하였다.

2.1.2 Problem Prompt

Problem Prompt는 수행할 과제에 대한 자세한 설명을 제공한다. 실험에 사용된 4개의 데이터 셋(BoolQ, QNLI, SST2, MRPC)은 각기 다른 자연어 처리(NLP)과제로, 해당 과제의 문제 설명을 프롬프트에 포함하였다. 모든 답변은 “True” 또는 “False”로 응답하도록 지시하였다.

2.1.3 Reasoning Prompt

Reasong Prompt는 모델이 단순히 정답만 제시하는 것을 넘어 해당 답에 이른 이유를 함께 설명하도록 한다. 이 프롬프트는 Prompt-2, 3에만 사용되었으며 “You should also give a reason for your answer.”와 같은 지시어를 포함한 답변의 근거를 제시하도록 요구하여 답변의 일관성을 높이고자 하였다.

2.1.4 Example(One-shot)

One-shot 예시는 모델에 실제 질문과 유사한 예시 질문 및 답변 형식을 한 번만 보여주는 방식이다. 이를 통해 모델이 과제를 더 잘 이해하고 결과를 생성하도록 돕는다. 또한 { “answer” : “True” }와 같이 JSON 형식으로 답변을 출력하도록 프롬프트에 명시하였다.

2.1.5 Instruction

마지막으로 Intsruction은 모델이 실제로 해결해야 할 구체적인 질문이나 작업을 의미한다. 예를 들어, BoolQ 데이터셋의 경우 “Do iran and afghanistan speak the same language?” 와 같은 질문이 Instruction으로 주어진다. 모델은 앞서 정의된 System Role, Problem, Reasoning, Example 프롬프트를 바탕으로 Instruction을 처리하고 최종 답변을 생성하게 된다.

2.2 모델

본 연구의 실험에 사용된 LLM은 상용 챗봇(Chatbot) 형태로 널리 사용되는 Closed-Source 모델 2개와 대표적인 Open-Source 모델인 LLama를 선정하여 총 3개의 모델을 사용하였다.

모델 선정 시, 가장 작은 규모로 공개되었거나 상대적으로 크기가 작은 모델을 먼저 고려하였다. 또한 모델이 특정 시점 정보에 편향되지 않도록 사전 학습 데이터의 최신 정보 반영 기준점인 Knowledge Cutoff가 최대한 유사한 시점의 모델들을 선택하였다. 실험에 사용된 모델과 모델의 Knowledge Cutoff 정보는 Table 3와 같다.

Table 3. Models Used

SOOOB6_2025_v28n5_2_1517_5_t0001.png 이미지

2.3 데이터셋

본 실험에서는 BoolQ, QNLI, MRPC, SST2의 4가지 데이터셋을 사용하였다. 각 데이터셋은 이진 분류 과제로 모델의 출력을 정량적으로 평가 할 수 있다. 또한 GLUE(General Language Understanding Evaluation) Benchmark[21]에서 평가하는 주요 자연어 처리 과제인 추론(Inference), 유사성 및 의역(Similarity and Paraphrase), 그리고 단일 문장(Single-Sentence)을 포괄하도록 대표적인 데이터셋을 선정하여 모델의 성능과 일관성을 범용적으로 측정하고자 하였다. 일관성 측정을 위해 각 Prompt 형태에 따라 데이터셋과 모델을 달리하여 10회씩 실험하였다. 데이터셋 과제 설명은 2.3.1부터 2.3.5까지 기술되어 있으며 전체 데이터셋의 속성과 실험에 사용된 개수는 Table 4에서 확인가능하다. 또한 사전 학습된 LLM에서 발생할 수 있는 학습 데이터 유출을 방지하고자 평가 데이터는 공개된 데이터셋의 학습 데이터를 제외하고 검증용 데이터로만 구성했다[23].

Table 4. Dataset Structure and Size

SOOOB6_2025_v28n5_2_1517_5_t0002.png 이미지

2.3.1 BoolQ (추론)

BoolQ는 “예/아니오”로 답할 수 있는 질문에 대한 데이터셋이다. 주어진 질문(Question)과 답변(Answer), 답변이 포함된 지문(Passage)로 구성되어 있다. 전체 12,700개의 데이터 중 평가를 위한 3,270개의 검증용 데이터를 이용하였다.

2.3.2 QNLI (추론)

QNLI는 질문(Text1)과 문장(Text2) 쌍으로 구성된 데이터셋으로 주어진 문장이 질문에 대한 정답을 포함하고 있는지(entailment)를 판별하는 과제이다. 이는 모델이 질문과 문장 간의 논리적 관계를 이해하는 능력을 평가하는 데 사용된다. 전체 110,206개 중 평가를 위한 검증용 데이터 5,463개를 사용하였다.

2.3.3 SST2 (단일 문장)

SST2는 영화 리뷰와 같은 단일 문장(Text)의 감성을 긍정 또는 부정으로 분류하는 단일 문장 과제 데이터셋이다. 모델의 감성 분석 능력을 평가하는 데 주로 사용된다. 전체 7,792개의 데이터로 구성되며 평가를 위한 검증용 데이터 872개만을 사용하였다.

2.3.4 MRPC (유사성 및 의역)

MRPC는 두 개의 문장(Text1, Text2)이 의미상으로 동일한지, 즉 서로 의역(Paraphrase) 관계인지를 판별하는 데이터셋이다. 이는 유사성 및 의역 과제에 속하며 모델이 문장의 의미적 동등성을 얼마나 잘 파악하는지를 측정한다. 전체 4,076개의 데이터셋 중 평가를 위한 검증용 데이터 408개만을 사용하였다.

2.4 평가

평가지표는 정확도, 정밀도 재현율 F1-score, 표준편차(F1-score standard deviation)를 사용하였으며 GLUE Benchmark 데이터셋에서 사용되는 평가지표를 참고하여 선정하였다[21]. 각 데이터셋 과제에 맞게 작성된 3가지 프롬프트를 3가지 모델에서 10회씩 실험 진행하여 성능을 평가하였고 모델이 생성하는 답변의 일관성을 평가하기 위해 10회씩 실험되어 측정된 성능의 평균과 표준편차를 사용하였다.

3. 실험결과

본 연구는 프롬프트 엔지니어링 기법을 활용하여 LLM의 응답 안정성 및 일관성 향상에 대한 연구를 수행했다. GPT-4o-mini, Gemini-2.0-FL(Gemini-2.0-flash-lite), Llama 3.1 8B IT(Llama 3.1 8B Instruct Trubo) 3가지 모델과 BoolQ, QNLI, SST2, MRPC 네 가지 데이터셋을 사용하였다. Prompt-1(기본 프롬프트), Prompt-2(답변과 답변 근거 요구), Prompt-3(답변 근거를 답변 보다 먼저 제시)의 3가지 프롬프트 유형이 모델의 성능(Accuracy, Precision, Recall, F1-score)과 일관성(F1-Score의 표준편차)에 대해 미치는 영향을 분석한다. 모델 별 실험 결과는 3.1부터 3.3까지 기술되어 있으며, 3.4에서 모델, 데이터셋, 프롬프트의 결과 비교가 기술되어 있다.

3.1. GPT-4o-mini

Table 5는 GPT-4o-mini의 결과다. Table 5에 따르면 Prompt-3이 F1-Score 82.24로 평균 성능이 가장 높았다. 그리고 Prompt-2(78.76), Prompt-1(74.66) 순으로 정확도가 높은 것을 확인할 수 있다. 일관성 측면에서는 Prompt-2의 표준편차가 0.52로 가장 낮았다. 반면, Prompt-3은 평균 성능은 가장 높았지만 표준편차가 1.13으로 Prompt-2에 비해 높게 나타났다.

Table 5. GPT-4o-mini Results (Unit: %)

SOOOB6_2025_v28n5_2_1517_6_t0001.png 이미지

이는 프롬프트에 답변의 근거를 출력하도록 유도함으로써 모델이 중간 추론을 명시화하여 임의추측을 줄이고 F1 성능에 긍정적인 영향을 미친 것으로 해석할 수 있다.

데이터셋별 성능 면에서는 MRPC에서 프롬프트 엔지니어링의 효과가 특히 컸으며 Prompt-3이 Prompt-1 대비 75.2% 향상되었다. 일관성 측면에서는 BoolQ 데이터셋이 Prompt-2의 표준편차가 Prompt-1대비 73.8% 감소하여 가장 큰 안정성 개선을 보였다.

3.2 Gemini-2.0-flash-lite

Table 6은 Gemini-2.0-FL의 결과다. Table 6에 따르면 Prompt-3이 F1-Score 69.40로 평균 성능이 가장 높았고 이어서 Prompt-2(66.17), Prompt-1(65.20) 순이었다. 이는 Gemini 계열에서도 답변의 근거를 요구하는 프롬프트가 전반적 성능 향상에 긍정적으로 작용했음을 시사한다. 일관성 측면에서는 Prompt-2의 표준편차가 1.57로 가장 낮아, 변동성이 가장 적었다.

Table 6. Gemini-2.0-flash-lite Results (Unit: %)

SOOOB6_2025_v28n5_2_1517_7_t0001.png 이미지

Table 7. Llama 3.1 8B Instruct Turbo Results (Unit: %)

SOOOB6_2025_v28n5_2_1517_8_t0001.png 이미지

데이터셋별로 보면, GPT-4o-mini와 마찬가지로 MRPC에서 프롬프트 엔지니어링의 효과가 특히 크게 나타났으며 Prompt-3이 Prompt-1 대비 41.6% 향상되었다. 일관성 측면에서도 GPT-4o-mini와 동일하게 BoolQ에서 Prompt-2의 표준편차가 Prompt-1 대비 59.3% 로 감소하여 가장 큰 안정성 개선을 보였다.

3.3 Llama 3.1 8B Instruct Turbo

Table 6는 Llama 3.1 8B IT의 결과다. Table 6을 보면 Prompt-2이 F1-Score 77.57로 평균 성능이 가장 높았다. 이어서 Prompt-1(75.98), Prompt-3(76.88) 순이었다. GPT-4o-mini와 Gemini-2.0-FL과 달리 Llama 3.1 8B IT에서는 Prompt-2가 F1-Score 성능이 가장 높았다. 일관성 측면에서는 Prompt-2의 표준편차 0.18로 가장 낮았다.

데이터셋 별로는 MRPC에서 Prompt-3이 Prompt-1 대비 23% 향상되었다. 일관성 측면에서는 SST2에서 Prompt-2의 표준편차가 Prompt1 대비 63.5% 감소하여 가장 큰 안정성 개선을 보였다.

3.4 결과 분석

Fig. 3은 모델 별 결과를 평균으로 합산하여 비교한 그래프이다. 개별 모델에서는 Gpt-4o-mini와 Gemini-2.0-FL이 각각 Prompt-3이 F1-Score 가장 높은 반면에 Llama 3.1 8B IT에서는 예외적으로 Prompt-2가 가장 높았다. 일관성 측면에서는 세 모델 모두에서 Prompt-2가 각 모델의 세 프롬프트 결과 중에서 표준편차가 가장 낮은 것을 확인할 수 있다.

SOOOB6_2025_v28n5_2_1517_9_f0001.png 이미지

Fig. 3. Comparison of Results by Model

Fig. 4은 데이터셋 별 결과를 평균으로 합산하여 비교한 그래프이다. 프롬프트 엔지니어링의 F1-Score 성능 향상은 MRPC에서 가장 컸다. Fig. 4은 데이터셋 별 결과를 평균으로 합산하여 비교한 그래프이다. 프롬프트 엔지니어링의 F1-Score 성능 향상은 MRPC에서 가장 컸다.

SOOOB6_2025_v28n5_2_1517_9_f0002.png 이미지

Fig. 4. Comparison of Results by Dataset

Fig. 4은 데이터셋 별 결과를 평균으로 합산하여 비교한 그래프이다. 프롬프트 엔지니어링의 F1-Score 성능 향상은 MRPC에서 가장 컸다. Prompt-2, Prompt-3 모두 Prompt-1 대비 큰 성능 향상을 가져왔다. 하지만 MRPC의 일관성 측면에서는 Prompt-2가 표준편차가 가장 낮았다. 반면 QNLI와 BoolQ에서 F1-Score는 Prompt-1 대비 Prompt-3이 오히려 하락하였다. 또한 QNLI에서는 Prompt-2 또한 Prompt-1과 비교하여 F1-Score가 하락한 것을 확인할 수 있다.

이를 통해 답변의 근거를 유도하여 모델의 중간 추론을 명시화하는 것이 항상 올바른 정답을 도출 해내는 것은 아니며 하락 할 수 있음을 확인할 수 있다. 반면 표준편차의 경우 Fig. 3과 Fig. 4를 보면 모든 경우에서 가장 낮았다. Fig. 5에서 프롬프트 별 결과를 비교 확인할 수 있다. 즉 답변의 일관성 측면에서는 중간 추론의 명시화를 통해 모델 답변의 일관성을 증가시킬 수 있음을 확인할 수 있다.

SOOOB6_2025_v28n5_2_1517_9_f0003.png 이미지

Fig. 5. Comparison of Results by Prompt

4. 결론

본 연구는 프롬프트 엔지니어링을 통해 LLM의 응답 안정성과 일관성을 향상시키는 실용적인 방안을 탐구했다. 별도의 모델 수정이나 외부 시스템 연동 없이 답변의 근거를 요구하는 간단한 프롬프트 설계만으로 모델의 추론 과정을 유도하고 그 효과를 검증하고자 했다.

실험은 3개의 LLM과 4개의 데이터셋을 이용하여 기본 프롬프트(Prompt-1)과 답변의 근거를 요구하는 프롬프트(Prompt-2,3)의 성능을 비교 분석하는 방식으로 진행되었다. 실험결과, 답변과 함께 근거를 제시하도록 한 Prompt-2 방식이 모델이나 과제 유형과 관계없이 가장 일관된 응답을 유도함을 확인했다. 이를 통해 답변의 이유를 요구하는 방식이 절대적인 성능 향상을 보장하진 않더라도, 보다 일관적이고 안정적인 결과물을 생성하게 함으로써 LLM의 신뢰도를 높이는 효과적인 전략임을 알 수 있다.

본 연구의 가장 큰 의의는 많은 비용이 드는 모델 미세조정과 복잡한 구현이 필요한 외부 시스템 연동없이 프롬프트에 이유를 묻는 간단한 방법으로 LLM의 응답 안정성을 효과적으로 확보할 방안을 제시했다는 점이다. 이러한 접근법은 특정 과제에 한정되지 않고 범용적으로 사용될 수 있다.

향후 연구에서는 더 복잡한 생성 과제와 다양한 언어 및 모델 환경에서 본 방법론의 유효성을 검증하려 한다. 또한 답변의 근거를 요구하는 프롬프트가 모델 내부 구조 및 학습 과정에서 어떤 영향을 주는지 연구하고자 한다.

참고문헌

  1. Wei, J., Wang, X., Schuurmans, D., Bosma, M., Xia, F., Chi, E., ... & Zhou, D. "Chain-of-thought prompting elicits reasoning in large language models." NIPS, 35, 24824-24837. (2022).
  2. Anil, R., Dai, A. M., Firat, O., Johnson, M., Lepikhin, D., Passos, A., ... & Wu, Y. "Palm 2 technical report." arXiv preprint arXiv:2305.10403. (2023).
  3. Chen, M., Tworek, J., Jun, H., Yuan, Q., Pinto, H. P. D. O., Kaplan, J., ... & Zaremba, W. "Evaluating large language models trained on code." arXiv preprint arXiv:2107.03374. (2021).
  4. Hendrycks, D., Burns, C., Basart, S., Zou, A., Mazeika, M., Song, D., & Steinhardt, J. "Measuring massive multitask language understanding." arXiv preprint arXiv:2009.03300. (2020).
  5. Katz, D. M., Bommarito, M. J., Gao, S., & Arredondo, P. " Gpt-4 passes the bar exam." Philosophical Transactions of the Royal Society A, 382(2270), 20230254. (2024). https://doi.org/10.1098/rsta.2023.0254
  6. Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F. L., ... & McGrew, B. "Gpt-4 technical report." arXiv preprint arXiv:2303.08774. (2023).
  7. Team, G. "Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities." Technical report, Google, 2025. Technical Report. 2, 7. (2025).
  8. Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. "Bert: Pre-training of deep bidirectional transformers for language understanding." NAACL: Human Language Technologies, volume 1 (long and short papers) (pp. 4171-4186). (2019). https://doi.org/10.18653/v1/N19-1423
  9. Lee Rainie "Close encounters of the AI kind: Main report" Imagining the Digital Futrue Center of Elon University (2025).
  10. Owens, Brian. "How Nature readers are using ChatGPT." Nature 615.7950 (2023). https://doi.org/10.1038/d41586-023-00500-8
  11. Liao, Z., Antoniak, M., Cheong, I., Cheng, E. Y. Y., Lee, A. H., Lo, K., ... & Zhang, A. X. "LLMs as Research Tools: A Large Scale Survey of Researchers' Usage and Perceptions." arXiv preprint arXiv:2411.05025. (2024).
  12. Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., ... & Fung, P. "Survey of hallucination in natural language generation." ACM computing surveys, 55(12), 1-38. (2023). https://doi.org/10.1145/3571730
  13. Orlando Ayala and Patrice Bechard. "Reducing hallucination in structured outputs via Retrieval-Augmented Generation." NAACL: Human Language Technologies (Volume 6: Industry Track), pages 228–238, (2024).
  14. Chen, Z. Z., Ma, J., Zhang, X., Hao, N., Yan, A., Nourbakhsh, A., ... & Wang, W. Y. "A survey on large language models for critical societal domains: Finance, healthcare, and law." arXiv preprint arXiv:2405.01769. (2024).
  15. Jingyuan Yang, Dapeng Chen, Yajing Sun, Rongjun Li, Zhiyong Feng, and Wei Peng. "Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented Approach." ACL, pages 3343–3353, (2024).
  16. Ziwei Ji, Zihan Liu, Nayeon Lee, Tiezheng Yu, Bryan Wilie, Min Zeng, and Pascale Fung. "RHO: Reducing Hallucination in Open-domain Dialogues with Knowledge Grounding." Findings-ACL, pages 4504–4522, (2023).
  17. Wang, Xuezhi, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou. "Self-consistency improves chain of thought reasoning in language models." arXiv preprint arXiv:2203.11171 (2022).
  18. Barnett, S., Kurniawan, S., Thudumu, S., Brannelly, Z., & Abdelrazek, M. "Seven failure points when engineering a retrieval augmented generation system." In Proceedings of the IEEE/ACM 3rd International Conference on AI Engineering-Software Engineering for AI (pp. 194-199). (2024).
  19. Clark, C., Lee, K., Chang, M. W., Kwiatkowski, T., Collins, M., & Toutanova, K. " Boolq: Exploring the surprising difficulty of natural yes/no questions." arXiv preprint arXiv:1905.10044. (2019).
  20. Wang, A., Singh, A., Michael, J., Hill, F., Levy, O., & Bowman, S. R. "GLUE: A multi-task benchmark and analysis platform for natural language understanding." arXiv preprint arXiv:1804.07461.(2018).
  21. Powers, D. M. "Evaluation: from precision, recall and F-measure to ROC, informedness, markedness and correlation." arXiv preprint arXiv:2010.16061. (2020).
  22. Oscar Sainz, Jon Campos, Iker García-Ferrero, Julen Etxaniz, Oier Lopez de Lacalle, and Eneko Agirre. "NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark." EMNLP pages 10776–10787, (2023)