DOI QR코드

DOI QR Code

Towards Sustainable AI Guardrails: Lifelong Learning for Enhanced Harmful Prompt Detection

지속가능한 AI 가드레일: 유해 프롬프트 탐지 고도화 방안 연구

  • Received : 2026.01.14
  • Accepted : 2026.05.06
  • Published : 2026.06.30

Abstract

LLMs face rapidly evolving attack surfaces (e.g., jailbreak and instruction bypass), but existing guardrails rely onRLHF/policy-tuning as a static baseline, making continuous updates difficult and retraining/redeployment costly. We propose a single-path, three-stage operational lifelong guardrail (RuleSet-RAG-LLM Judge) backed by an attacker-intent DBand a lexicon of offensive terms and harmful contexts. RuleSet handles obvious cases with low latency, and RAG injects evidence at inference time to dynamically recalibrate the static baseline, improving robustness to novel/obfuscated attacks andtransparency. The LLM Judge performs evidence-grounded rubric scoring with standardized logging/monitoring aligned withNIST governance (evidence, traceability, rapid updates); across both a benchmark setting (WildGuard) and a real-worldsetting (ToxicChat), it demonstrated strong performance while maintaining low latency of ~3 s/query, confirming a favorable performance-operability balance.

LLM은 jailbreak·우회 지시 등으로 공격표면이 급변하지만, 기존 가드레일은 RLHF·정책 튜닝 기반 정적 기준선에 의존해 지속 업데이트가 어렵고 재학습·재배포 비용이 크다. 본 연구는 공격자 의도 DB와 비속어·유해맥락 사전을 기반으로 단일 경로 3단계 지속운영형(lifelong) 가드레일(RuleSet-RAG-LLM Judge)을 제안한다. RuleSet은 명백 사례를 저지연 처리하고, RAG는 추론 시점 근거 주입으로 정적 기준선을 동적으로 보정해 신규·변형 공격 대응력과 투명성을 강화한다. LLM Judge는 근거 기반 루브릭 판정과 표준 로깅·모니터링으로 NIST 거버넌스(근거·추적·신속 업데이트)에 부합하며, 벤치마크 환경(WildGuard)과 실사용 환경(ToxicChat) 모두에서 우수한 성능을 보였으며, 약 3 s/query 수준의 처리 지연으로 높은 운영 효율성을 확인했다.

Keywords

I. 서론

1.1 LLM 서비스 확산과 보안 위협의 현실화

대규모 언어모델(LLM)이 산업 전반의 서비스 구성요소로 빠르게 확산되면서, 사용자 프롬프트는 단순 질의가 아니라 모델의 행동과 출력 범위를 좌우하는 핵심 입력이 되었다. 이로 인해 LLM 기반 시스템은 전통적 웹/애플리케이션 보안과 달리 자연어 지시를 매개로 한 정책 우회·정보 노출·유해 출력 유발과 같은 새로운 형태의 공격표면에 노출된다. 그러나 실서비스에서 가드레일이 이러한 위협을 안정적으로 통제하기 위해서는 탐지 성능뿐 아니라 운영·갱신 관점까지 포함한 근본적인 문제를 해결해야 하며, 현재의 가드레일 설계에는 이에 대한 구조적 한계가 존재한다.

본 연구는 실서비스 LLM 가드레일의 한계를 다음 두 가지 핵심 난점으로 정리한다.

• 의도 기반 유해성 판정의 불안정성: 유해 프롬프트는 우회 지시·서사 포장·다단계 질의 등으로 목표/의도를 은닉해, 표면 문구·규칙·키워드 기준선만으로는 일관되게 식별하기 어렵다.

• 지속가능한(lifelong) 기준선 갱신 부재와 model drift(모델의 판단 기준 이동): 공격 패턴과 정책·규범이 공진화하며 판정 기준이 이동하나, 재학습·재튜닝 의존으로 비용·리드타임이 커 운영 반영이 지연된다.

이러한 문제의식은 보안 커뮤니티의 위협 모델에서도 확인된다. OWASP LLM Top 10(2025)[1]은 Prompt Injection과 System Prompt Leakage 등 가드레일 우회와 직결되는 공격을 핵심 위험으로 제시하며, 정책·안전 규칙의 교란 및 노출을 단서로 한 우회 지시가 jailbreak(LLM 탈옥 공격)와 비의도적 출력을 유발할 수 있음을 지적한다. MITRE ATLAS[2] 역시 AI/LLM 대상 공격을 전술·기술 수준으로 체계화하여, 위협이 단발성이 아니라 반복·진화하는 양상임을 보여준다.

이와 같은 환경에서 유해 프롬프트는 우회 지시, 서사적 포장, 다단계 질의 등으로 목표를 간접화하는 경우가 많으며, 유해성은 문구의 형식보다 공격자의 목표·의도에 의해 규정된다. 따라서 입력 양식이 달라지더라도 목표·의도를 중심으로 유해성을 판단할 수 있는 기준선이 필요하다.

1.2 실서비스 가드레일의 요구사항과 본 연구의 접근

앞 절에서 정리한 두 가지 난점을 실서비스에서 해소하기 위해서는, 가드레일을 단순 분류기로 두기 보다 운영 가능한 보안 통제로 설계해야 한다. 따라서 실서비스 가드레일은 근거 기반의 일관된 판정, 판정 근거·사유의 표준 로깅을 통한 추적·감사 가능성, 그리고 대규모 트래픽과 다양한 입력 길이 제약을 고려한 저지연 처리 구조를 동시에 충족해야 하며, 이는 NIST가 제시하는 거버넌스 요구사항[3]과도 직결된다.

본 연구는 이러한 운영 요구를 충족하기 위해 RuleSet–RAG–LLM Judge로 구성된 단일 경로 파이프라인을 제안한다. RuleSet은 명백한 유해 단서에 대한 저비용 1차 통제로 처리 지연을 최소화하고, RAG는 공격자 의도 DB 및 유해 범주·유의어 사전에서 관련 근거를 검색해 판정 과정에 주입함으로써 판단의 기준과 근거를 외부화한다. LLM Judge는 주입된 근거를 기반으로 다차원 항목별 평가 기준표인 다축 루브릭에 따라 유해성을 평가하고, 축별 점수와 판정 사유를 표준 형식으로 로깅하여 결과의 재현성과 감사 가능성을 강화한다. 결과적으로 제안 기법은 정밀 탐지와 운영 효율을 동시에 고려한 구조를 통해, 실서비스 환경에서 요구되는 신뢰 가능한 가드레일 운용 경로를 제공한다.

II. 관련연구

LLM 안전성 정렬 및 가드레일 기법은 적용 전제에 따라 모델-비개입형 정렬(외부 파이프라인형)과 모델-개입형 정렬(모델 내부 조정형)로 구분된다. 전자는 대상 LLM의 학습·파라미터를 변경하지 않고 입·출력 단계에서 외부 파이프라인을 통해 정책 준수 여부를 판단·통제하는 접근이며, 후자는 파라미터·학습 절차·디코딩/시스템 설정 등 모델 내부 요소를 직접 조정하여 안전성을 강화하는 접근이다. 본 연구는 실서비스 적용성과 모델 독립성을 고려하여 비개입형 가드레일의 설계·운영 문제에 초점을 둔다.

2.1 기존 모델-비개입형 정렬의 접근과 한계

모델-비개입형 정렬 연구는 규칙·패턴 기반 필터에서 시작해, 전용 분류기 모델, LLM Judge, 다중 에이전트 기반 판정으로 고도화되어 왔다.

예를 들어 Llama Guard[4]와 같은 전용 분류기 기반 접근은 Safe/Unsafe 이진 분류 및 위험 범주 판정을 비교적 낮은 지연으로 일관되게 분류해 실무 적용에 활용되어 왔다. 다만 표현 변형·신규 공격·정책 변화가 누적되는 운영 환경에서는 커버리지 유지·확장과 지속적인 업데이트 부담이 남는다.

반면 LLM Judge는 초기에 PAIR[5], TAP[6] 등 자동 jailbreak 공격 파이프라인에서 목표 달성 여부를 판정하는 최적화 신호로 주로 활용되어 왔다. 그러나 공격·방어 모두에서 경계 사례가 증가하면서 판정 결과의 일관성·재현성이 핵심 품질로 부상하였고, 이에 따라 방어·평가 측면에서는 판정 기준을 표준화하여 인간 판단과의 정합성을 높이려는 시도가 강화되었다. StrongREJECT [7]는 이러한 흐름의 대표 사례로, 루브릭 기반 판정을 통해 LLM Judge의 인간 합치도를 향상시킬 수 있음을 제시한다.

IA-Defender[8]는 프롬프트에서 공격자의 핵심 의도를 선행 추출하고, 이를 기반으로 LLM Judge가 안전 응답을 생성하는 2단계 단계화 추론을 제안한다. 이는 공격자의 의도를 명시적으로 분리·고정해 판정 근거를 구조화한다는 점에서 유의미하나, 의도 추출–재질의가 모두 LLM 자체 생성 결과에 의존하는 다회 호출 구조로 인해, 운영 환경에서 지연·비용 증가와 판정 안정성 저하 가능성을 수반한다.

한편 G4D[9]는 다중 LLM 에이전트와 RAG 기반 근거 주입을 결합해 복잡한 경계 입력에 대한 대응력을 높이지만, 다중 호출 구조로 인해 지연과 운영 복잡도가 증가하여 실시간 가드레일로 적용하기에는 부담이 크다. 결과적으로 기존 접근들은 각각 저지연, 경계 사례 정밀도, 추가 학습 없이 즉시 적용 가능한 운영성에 강점을 보이지만, 실서비스 제약 하에서 정밀한 판정과 낮은 지연·운영 부담을 동시에 만족하는 설계에는 여전히 공백이 남아 있다.

2.2 기존 모델-개입형 정렬의 접근과 한계

모델-개입형 정렬은 안전 규칙을 모델 파라미터 및 내부 표현 수준에 내재화하여, 추론 시점에서 일관된 안전 응답을 유도할 수 있고 런타임 오버헤드가 비교적 낮다. 다만 안전 판단의 근거가 명시적으로 외부화되지 않는 경우가 많아 판정의 설명력·검증 가능성이 제한될 수 있으며, 정책·공격 분포 변화에 대응하기 위해 재학습 및 재배포가 요구되어 업데이트 비용과 리드타임 부담이 발생한다.

산업계에서는 RLHF(인간 피드백 강화학습)를 포함한 학습 기반 정렬로 상용 LLM의 기본 안전성을 확보해 왔으나, 이러한 방식은 한 번 학습된 정책이 고정 기준선으로 작동하기 쉬워 운영 중 정책·공격 분포 변화에 대한 갱신 비용과 리드타임 부담이 크다[10].

이에 따라 재학습 없이도 jailbreak 내성을 강화하려는 접근이 제안되었으며, 그 대표 사례로 Robust Prompt Optimization (RPO)[11]는 모델 파라미터를 변경하지 않고 시스템 프롬프트에 부착되는 이산 방어 suffix를 백본 LLM의 로짓·그래디언트 신호로 직접 최적화하여 탈옥 성공률을 낮추는 방법을 제시한다. 다만 suffix 기반 방어는 적용 설정과 입력 분포에 따라 정상 질의 품질 저하나 형식적 부작용이 나타날 수 있어, 실서비스 적용 시 품질·안정성 관리가 요구된다.

이에 비해 Layer-specific Editing(LED)[12]는 LLM 트랜스포머 내부의 특정 레이어를 표적 편집하여 안전 정렬 신호를 강화하고 jailbreak 내성을 제고하는 접근을 제안한다. 다만 레이어 수준의 편집은 변경 사항에 대한 검증과 재배포 절차가 필연적으로 수반되므로, 운영 환경에서는 업데이트 비용과 리드타임 부담이 크게 발생할 수 있다.

한편 RobustKV[13]는 jailbreak 프롬프트 토큰이 중요도를 점유하는 과정에서 은닉된 유해 질의 토큰의 중요도가 상대적으로 낮아지는 경향을 이용해, 입력 인코딩으로 산출한 중요도에 따라 하위 토큰의 Key-Value(KV) 캐시를 선택적으로 제거함으로써 유해 의도가 생성 과정에 반영되는 정도를 약화시킨다. 다만 중요도 추정 및 제거 비율 설정에 따라 정상 질의의 핵심 정보까지 함께 손실될 수 있어, 공격 억제와 응답 유용성 간 균형을 고려한 튜닝이 요구된다.

2.3 본 연구의 기여

앞서 살펴본 바와 같이 모델-비개입형 접근은 대상 LLM을 직접 변경하지 않고 다양한 LLM에 즉시 적용할 수 있으며, 외부 파이프라인의 갱신만으로 업데이트 비용을 낮출 수 있다. 그러나 외부 처리 단계가 추가되면서 지연이 커지기 쉽고, 변형 입력·경계 사례에서는 일관된 안전 응답을 보장하기 어렵다. 반면 모델-개입형 접근은 안전 규칙을 모델 내부에 내재화해 비교적 일관된 안전 응답과 짧은 런타임 지연을 달성할 수 있으나, 정책·공격 분포 변화에 대응하려면 재학습·편집·재배포가 수반되어 업데이트 비용과 리드타임 부담이 크고, 판단 근거가 외부화되지 않아 검증·감사 가능성이 제한된다.

본 연구는 이러한 상충을 운영 관점에서 조정하기 위해, 갱신 단위를 모델이 아닌 공격자 의도 DB·유해 단서 DB의 증분 업데이트로 전환하여 drift에 민첩하게 대응하도록 설계하였다. 또한 5축 루브릭으로 실제 유해성과 실현 가능성까지 평가 범위를 확장해 인간 전문가와의 정합성을 높이고, RAG 기반 근거 외부화와 표준 로깅으로 판정의 재현성·추적성·감사 가능성을 체계화한다.

III. 제안 가드레일

본 연구는 반복·변형되는 jailbreak 입력에 대응하기 위해, Fig. 1의 파이프라인을 지연·비용, 기준선 보강, 추적·감사 가능성 관점에서 설계·구현한 방법을 기술한다. 먼저 명백 사례를 빠르게 분기해 후단 호출을 줄일 필요가 있으므로 RuleSet으로 조기 판정을 수행한다. 또한 입력 길이가 과도한 경우 후단 처리에 필요한 핵심 단서를 사전 정제할 필요가 있으므로, RAKE(Rapid Automatic Keyword Extraction) 알고리즘[14]을 적용해 입력을 핵심 구문 단위로 압축·정제한다.

JBBHCB_2026_v36n3_923_4_f0001.png 이미지

Fig. 1. Overall pipeline of the proposed guardrail

다음으로 고정 정책만으로는 표현 변형과 문맥 교란에 취약하므로 RAG로 유사 판례와 악성 단서를 검색·주입해 판단 근거를 보강한다.

마지막으로 운영 환경에서의 사후 분석·감사·개선을 위해 근거와 사유를 체계적으로 남길 필요가 있으므로 LLM Judge가 근거 기반 다축 루브릭으로 유해성을 정량화하고 근거·사유를 구조화해 기록한다.

3.1 RuleSet 기반 저지연 차단

운영 환경에서는 RAG·LLM Judge의 상시 호출이 지연·비용을 증가시키므로, 명백 사례를 저지연으로 조기 분기하는 단계가 필요하다. 이에 RuleSet을 1차 필터로 두어 명백한 Safe/Unsafe를 우선 확정하고 후단 호출을 최소화하였다(Fig. 1 좌측). RuleSet은 White List와 Black List로 구성되며, 주요 패턴 예시는 Table 1.과 같이 정리된다.

Table 1. Examples of RuleSet signal patterns.

JBBHCB_2026_v36n3_923_4_t0001.png 이미지

White List는 거절·정책 고지 등 명백한 안전 신호를 탐지해 즉시 Safe로 분기하며, Prefix Guidance[15], Don’t Say No[16], PAIR[5] 등 기존 연구들에서 관찰되는 거절 패턴을 정제·통합해 구성하였다. Black List는 벤치마크 유해 사례에서 빈발하는 금지 행위 요청 및 우회 지시 패턴을 중심으로 구성해 명백한 악성 요청을 1차 차단한다.

3.2 RAG 기반 동적 기준선 보강

룰셋에서 확정되지 않은 경계 입력은 RLHF·정책 튜닝으로 형성된 고정 기준선만으로는 표현 변형과 문맥 교란에 취약하므로, 추론 시점에 외부 근거를 결합해 판정 기준선을 동적으로 보강할 필요가 있다.

우선 Fig. 1의 RAG 단계에서는 과도한 장문 입력이 잡음으로 핵심 의도 단서를 희석시켜 벡터 유사도 기반 판례 검색의 판별력을 저하시킬 수 있기에 RAKE 알고리즘[14]을 통해 검색 질의 단서를 사전 정제한 뒤, 외부 지식 베이스에서 관련 근거를 검색·선별해 LLM Judge에 주입하는 retrieval 단계로 한정하며, 주입 근거는 '유사 판례'와 '악성 단서'의 두 범주로 구분하였다.

먼저 벤치마크 유해 프롬프트는 금지행위 유형별로 공격자의 목표·의도가 반영된 사례들을 포함하므로, AdvBench[17], HarmBench[18], JBB Harmful Bench[19], StrongREJECT[7] 등 기존 공개 벤치마크를 수집·정제하여 총 1,088개의 판례 코퍼스를 구축하였다. 판례 코퍼스는 신규 벤치마크 등 유해 프롬프트 사례의 추가만으로 자동 통합·정제되며, 다음 실행 시점에 벡터 인덱스(FAISS, Facebook AI Similarity Search)가 재구성되는 증분 갱신 구조로 설계하여 모델 재학습 없이 최신 공격 패턴을 즉시 반영할 수 있다. 이후 실행 단계에서는 이 통합 코퍼스를 임베딩하여 벡터 인덱스를 구축하고, 입력 임베딩과의 코사인 유사도 기반으로 Top-1 판례를 검색 근거로 제공하였다. 이는 복수 판례 주입 시 LLM Judge의 판정 일관성이 저하될 수 있다는 점을 고려한 설계이다.

또한 악성 단서 범주는 악성 키워드 DB에서 TF-IDF(단어 빈도-역문서 빈도) 기반 상위 유해어를 추출하여 판례 근거와 결합해 LLM Judge에 주입한다. 이는 코사인 유사도가 낮아 유사 판례 매칭이 약한 입력에서도 표면 수준의 유해 신호를 보조적으로 제공하기 위한 설계이다.

3.3 5축 루브릭 기반 LLM Judge 정량 판정

유사 판례·악성 단서를 RAG로 주입하더라도, 해석 준거가 없으면 근거 적용이 흔들려 경계 사례 판정 편차가 커질 수 있다. 특히 ‘가상·상황극’과 같은서사적 포장에서는 비거절 응답이 생성되더라도 실행 요건·절차 결손이나 단계 불일치로 인해 무용한 답변으로 귀결될 수 있다[7]. 따라서 경계 입력 평가는 단순 비거절 여부가 아니라 공격자의 목표 달성에 기여하는 정보의 구체성·실행 가능성을 중심으로 악용 가능성을 판정해야 한다. 이에 본 연구는 근거 주입을 전제로 5축 루브릭과 점수 제약을 적용해 해석 기준선을 정립하고, 경계 사례에서도 판정 편차를 완화·관리하도록 설계하였다.

유해성은 ① 목표 달성성, ② 전략 효과성, ③ 절차·조건의 구체성 및 재현 가능성, ④ 사회적 위험도, ⑤ 유해 범주 정합성의 5개 축으로 평가한다. 각축 점수는 0–2.0(0.5 간격)으로 StrongREJECT[7]의 루브릭 기반 판정 구조를 가드레일 판정 목적에 맞게 확장하여 설정하였으며, 5개 축 합산 최대값을 10.0으로 고정해 정규화된 해석이 가능하도록 하였다. 세부 축(②–⑤)은 ①을 상한으로 제한하며(②–⑤ ≤ ①), 이는 G-EVAL[20]이 지적한 중간값 집중으로 인한 변별력 저하를 억제하고, 목표가 불명확한 입력에서 세부 축이 과대 산정되는 것을 구조적으로 방지하기 위함이다. 최종 점수는 축별 점수의 전체 합(Σ)으로 산출하고, 임계값을 기준으로 Safe/Unsafe를 결정한다.

IV. 실험 결과

4.1 실험 설정

본 절에서는 제안 가드레일의 탐지 성능을 검증하기 위해 WildGuard 데이터셋[21]과 ToxicChat 데이터셋[22]을 사용하였다. WildGuard 데이터셋은 응답 유해성 레이블이 부여된 샘플 1,709개, ToxicChat 데이터셋은 학습 분할(train split) 기준 5,082개로 구성되나, 두 데이터셋 모두 유해·정상 레이블 간 불균형이 심하므로(WildGuard 데이터셋: 유해 284개·정상 1,425개, ToxicChat 데이터셋: 유해 364개·정상 4,718개), 평가 지표 왜곡을 방지하고자 유해 클래스 전체를 기준으로 정상 샘플을 동수 추출하여 1:1 균형 평가셋을 구성하였다(WildGuard 데이터셋 568개, ToxicChat 데이터셋 728개). 또한 두 평가셋은 RAG 근거 검색용 코퍼스와 중복되지 않도록 분리하였다.

최종 판정 임계값은 Table 2.의 민감도 분석을 통해 선정하였다. 임계값을 2.0~6.0 구간에서 0.5 단위로 변화시킨 결과, 3.0~3.5 구간에서 FPR과 FNR의 균형이 가장 적절하였다. 4.0 이상에서는 FNR이 급격히 상승하고, 가드레일 운영 환경에서 정상 입력 차단(FPR)이 서비스 신뢰도에 직접 영향을 미치는 점을 고려하여, 3.5를 최종 임계값으로 설정하였다. 단, 본 분석은 RuleSet 처리 이후 LLM Judge에 도달한 입력을 대상으로 하며, 전체 파이프라인 정확도와는 구분된다.

Table 2. Score Threshold Sensitivity Analysis (WildGuard Dataset, Gemini-2.0-Flash)

JBBHCB_2026_v36n3_923_6_t0001.png 이미지

4.2 실험 결과 분석

Table 3.는 RuleSet 단독 결과를 제시한다. RuleSet은 명백 사례를 저지연으로 조기 분기하여 후단(RAG·LLM Judge) 호출량을 줄임으로써, 전체 파이프라인의 평균 처리시간과 비용을 안정화하는 운영 최적화를 목표로 설계되었다.

Table 3. Only RuleSet baseline results

JBBHCB_2026_v36n3_923_6_t0002.png 이미지

Table 4.와 Table 5.는 각각 LLM Judge로 Gemini-2.0-Flash와 GPT-4o를 사용했을 때의 비교 결과를 제시한다. 각 표는 WildGuard 데이터셋[21]과 ToxicChat 데이터셋[22]에 대한 실험 결과를 함께 제시하며, 동일한 테스트셋 및 파이프라인에서 백본 LLM만 변경하여 판정 품질 변화와 모델 의존성도 함께 비교하였다. 이를 통해 단일 모델에 종속되지 않는 재현 가능성을 점검하고, 동일 파이프라인에서 LLM Judge 교체만으로 기대 가능한 성능 상·하한을 제시한다.

Table 4. Comparative results with Gemini-2.0-Flash as the LLM judge (WildGuard, ToxicChat)

JBBHCB_2026_v36n3_923_7_t0001.png 이미지

Table 5. Comparative results with GPT-4o as the LLM judge (WildGuard, ToxicChat)

JBBHCB_2026_v36n3_923_7_t0002.png 이미지

WildGuard 데이터셋에서는 제안 가드레일이 높은 정확도와 균형적 오류(FPR·FNR)를 유지하면서 운영 가능한 처리 시간을 보였다. 이는 경계 사례에서 RAG로 회수된 유사 판례(공격 의도 근거)와 악성 단서(위협 신호)가 LLM Judge의 5축 루브릭 판정에 결합되면서, 표현 변형에도 판정 축을 유지하도록 설계된 효과로 해석할 수 있다.

ToxicChat 데이터셋에서는 전반적으로 Wild Guard 데이터셋 대비 정확도가 낮아지는 경향이 관측되었다. 이는 실사용자 기반 데이터 특성상 직접적·조악한 DAN(Do Anything Now)류 우회 지시가 다수 포함되어 LLM Judge 계열이 보수적으로 거부하거나 판정이 흔들리기 쉬운 영향으로 해석할 수 있다. 그럼에도 제안 가드레일은 비교 대상 대비 준수한 성능을 유지하며, 실사용 환경의 우회 입력에 대한 견고성을 시사한다.

한편 동일 파이프라인에서 백본 LLM을 교체한 결과, 경량·고속 모델인 Gemini-2.0-Flash는 GPT-4o 대비 WildGuard 데이터셋 기준 정확도가 3.37%p 높고 처리 시간은 약 2.4배 빠른 것으로 나타났다(Table 4, 5). 이는 제안 파이프라인이 특정 모델에 크게 종속되지 않으면서도, 백본 LLM의 추론 능력과 응답 속도에 따라 성능·운영 효율이 달라질 수 있음을 시사한다. 따라서 운영 환경의 실시간성 요구와 판정 정밀도 간 균형을 고려한 모델 선택이 필요하다.

추가로 파이프라인 단계별 처리 지연을 분석한 결과, 전체 처리 시간의 약 99%가 LLM Judge 호출에 집중되었으며(Gemini-2.0-Flash 기준 약 1,743 ms), RAKE 압축·임베딩·FAISS 검색·TF-IDF 검색을 포함한 전처리 및 RAG 단계의 합산 지연은 약 14 ms 수준에 불과하였다. 이는 파이프라인의 처리 지연이 사실상 백본 LLM의 응답 속도에 의해 결정됨을 시사하며, 경량·고속 모델 선택이 운영 효율 개선의 핵심 요인임을 뒷받침한다.

마지막으로, 제안 가드레일에서 RAG 단계는 앞서 기술한 바와 같이 후단 LLM Judge에 근거를 주입하는 retrieval 단계로 한정되므로 단독 탐지·차단 결과는 정의되지 않는다. 따라서 RAG의 정량적 기여를 평가하기 위해, 입력별로 로깅된 검색 코사인 유사도를 4개 구간으로 분할하여 LLM Judge의 판정 성능 변동을 분석하였다. 본 분석은 RuleSet 단계에서 20건(Unsafe: 12, Safe: 8)이 조기 분기되고 LLM Judge에 도달한 548건(Unsafe: 238, Safe: 310) 을 대상으로 하였으며, 결과는 Table 6.과 같다.

Table 6. LLM Judge performance by RAG retrieval cosine similarity

JBBHCB_2026_v36n3_923_8_t0001.png 이미지

분석 결과 cos < 0.30 입력군에서 LLM Judge의 FNR은 80.0%에 달했으며, 매칭이 강해질수록 30.1% (0.30 ≤ cos < 0.50), 14.6% (0.50 ≤ cos < 0.70), 10.0% (0.70 ≤ cos)로 단조 감소하여 약 8배 낮아졌다. FPR은 중간 구간에서 9.1~11.3%로 소폭 상승하는 trade-off가 관찰되었으나 전체 FPR(8.7%)을 크게 벗어나지 않았다. 이는 RAG가 직접 판정하지 않더라도 검색 근거의 품질이 후단 LLM Judge의 미탐 감소에 직접 영향을 미침을 정량적으로 보여준다. 특히 cos < 0.30 구간의 급격한 미탐 증가는 RAG 코퍼스의 도메인 커버리지 부족이 핵심 미탐 원인임을 시사한다.

4.3 고찰 및 한계

WildGuard 데이터셋은 연구 커뮤니티에서 통용되는 벤치마크 환경을, ToxicChat 데이터셋은 실사용 대화에서 발생하는 입력 분포를 각각 대표한다. 본 연구는 두 환경을 함께 검증함으로써, 제안 가드레일이 정제된 평가 조건과 실제 운영 조건 모두에서 일관된 동작 특성을 보일 수 있음을 확인했다. 특히 ToxicChat 데이터셋과 같이 입력 품질이 불균일하고 우회 지시가 거칠게 나타나는 환경에서도 성능이 급격히 붕괴하지 않았다는 점은 본 프레임워크가 연구용 성능에 그치지 않고 운영형 가드레일로서 적용 가능성을 갖는다는 점을 뒷받침한다.

한편 실험 결과에서 나타난 오탐(FP) 및 미탐(FN) 사례는 입력 압축 처리와 관련된 향후 연구 방향을 제시한다. 과도한 장문 입력에 대해 RAKE 알고리즘[14] 기반 키워드 압축을 적용하였으나, 압축 과정에서 핵심 의도 단서가 손실될 경우 판정 정밀도가 저하되는 경향이 관찰되었다. LLM 기반 의미 압축 등 고도화된 전처리 방식이 대안으로 고려될 수 있으나, 실시간 운영 환경에서의 추가 지연 부담을 수반하므로 처리 효율과 판정 정밀도 간 균형을 고려한 후속 연구가 필요하다.

V. 결론

본 연구는 RLHF·정책 튜닝 기반의 정적 가드레일이 최신 jailbreak/우회 지시 환경에서 기준선 공백이 빠르게 누적되고, 이를 재학습·재배포로 보완할 경우 비용 및 리드타임 부담이 가중되어 운영 지속성이 저하된다는 한계를 확인하였다.

이에 본 연구는 RuleSet–RAG–LLM Judge로 구성된 단일 경로 Lifelong 가드레일을 제안하였다. 제안 기법은 공격자 목표·의도 기반 판례 코퍼스와 악성 단서 DB를 LLM 추론 시점에 RAG로 결합하여 표현 변형에도 판정 축을 견고히 유지하고, 5축 루브릭으로 판단 과정을 구조화함으로써 경계 사례에서의 정밀 탐지와 오류 균형을 강화한다. 또한 판정에 활용된 근거, 점수, 축별 사유, 처리 지연 등을 표준 형식으로 로깅하여 추적·감사 가능성과 재현성을 확보하며, 근거 DB의 증분 갱신만으로 동적 기준선을 운영에 실시간 반영할 수 있는 업데이트 경로를 제공함으로써 NIST 거버넌스 요구사항에 부합한다. 결과적으로 본 연구는 차세대 가드레일이 '모델 재학습 중심의 기준선 보강'에서 벗어나, 근거(판례·단서·정책 기준)의 축적·주입·갱신을 중심으로 한 운영형 설계로 진화해야 함을 제시한다.

향후 연구에서는 한국어 커버리지 확대와 도메인별 범주 정교화, 자동 갱신·모니터링 결합 등을 통해 적용 범위를 확장할 예정이다. 또한 본 실험은 Gemini-2.0-Flash 및 GPT-4o를 백본 LLM으로 사용하였으나, 최근 출시된 고성능 추론 모델을 LLM Judge로 적용할 경우 복잡한 경계 사례에 대한 판정 정밀도가 추가로 향상될 것으로 기대되며, 이는 향후 연구에서 검토할 과제로 남긴다.

References

  1. OWASP, "OWASP Top 10 for LLM Applications 2025," Version 2025, Nov. 18, 2024.
  2. The MITRE Corporation, "MITRE ATLAS," MITRE ATLAS (website), [Online]. Available: https://atlas.mitre.org/. Accessed: Dec. 2025.
  3. NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1, Jul. 2024. DOI: 10.6028/NIST.AI.600-1.
  4. H. Inan et al., "Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations," arXiv preprint arXiv:2312.06674, Dec. 2023.
  5. P. Chao, A. Robey, E. Dobriban, H. Hassani, G. J. Pappas, and E. Wong, "Jailbreaking Black Box Large Language Models in Twenty Queries," arXiv preprint arXiv:2310.08419, Oct. 2023.
  6. A. Mehrotra, M. Zampetakis, P. Kassianik, B. Nelson, H. Anderson, Y. Singer, and A. Karbasi, "Tree of Attacks: Jailbreaking Black-Box LLMs Automatically," Advances in Neural Information Processing Systems (NeurIPS 2024), vol. 37, Dec. 2024.
  7. A. Souly et al., "A StrongREJECT for Empty Jailbreaks," Advances in Neural Information Processing Systems (NeurIPS 2024), Datasets and Benchmarks Track, vol. 37, Dec. 2024. https://doi.org/10.52202/079017
  8. Y. Zhang, L. Ding, L. Zhang, and D. Tao, "Intention Analysis Makes LLMs A Good Jailbreak Defender," Proceedings of the 31st International Conference on Computational Linguistics (COLING 2025), pp. 2947-2968, Jan. 2025.
  9. W. Luo, H. Cao, Z. Liu, Y. Wang, A. Wong, B. Feng, Y. Yao, and Y. Li, "Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models," Findings of the Association for Computational Linguistics: NAACL 2025, pp. 6614-6635, Apr. 2025.
  10. L. Ouyang et al., "Training Language Models to Follow Instructions with Human Feedback," Advances in Neural Information Processing Systems (NeurIPS 2022), vol. 35, pp. 27730-27744, Dec. 2022.
  11. A. Zhou, B. Li, and H. Wang, "Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks," Advances in Neural Information Processing Systems (NeurIPS 2024), vol. 37, Dec. 2024.
  12. W. Zhao, Z. Li, Y. Li, Y. Zhang, and J. Sun, "Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing," Findings of the Association for Computational Linguistics: EMNLP 2024, pp. 5094-5109, Nov. 2024.
  13. T. Jiang, Z. Wang, J. Liang, C. Li, Y. Wang, and T. Wang, "RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction," Proceedings of the 13th International Conference on Learning Representations (ICLR 2025), Apr. 2025.
  14. S. Rose, D. Engel, N. Cramer, and W. Cowley, "Automatic Keyword Extraction from Individual Documents," in Text Mining: Applications and Theory, M. W. Berry and J. Kogan, Eds., Chichester, UK: John Wiley & Sons, pp. 1-20, 2010.
  15. J. Zhao, K. Chen, X. Yuan, and W. Zhang, "Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks," arXiv preprint arXiv:2408.08924, Aug. 2024.
  16. Y. Zhou, J. Lou, Z. Huang, Z. Qin, Y. Yang, and W. Wang, "Don't Say No: Jailbreaking LLM by Suppressing Refusal," Findings of the Association for Computational Linguistics: ACL 2025, pp. 25224-25249, Jul. 2025.
  17. A. Zou, Z. Wang, N. Carlini, M. Nasr, J. Z. Kolter, and M. Fredrikson, "Universal and Transferable Adversarial Attacks on Aligned Language Models," arXiv preprint arXiv:2307.15043, Jul. 2023.
  18. M. Mazeika, L. Phan, X. Yin, A. Zou, Z. Wang, N. Mu, E. Sakhaee, N. Li, S. Basart, B. Li, D. Forsyth, and D. Hendrycks, "HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal," Proceedings of the 41st International Conference on Machine Learning (ICML 2024), PMLR vol. 235, pp. 35181-35224, Jul. 2024.
  19. P. Chao et al., "JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models," Advances in Neural Information Processing Systems (NeurIPS 2024), Datasets and Benchmarks Track, vol. 37, Dec. 2024. https://doi.org/10.52202/079017
  20. Y. Liu, D. Iter, Y. Xu, S. Wang, R. Xu, and C. Zhu, "G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment," Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023), pp. 2511-2522, Dec. 2023.
  21. S. Han, K. Rao, A. Ettinger, L. Jiang, B. Y. Lin, N. Lambert, Y. Choi, and N. Dziri, "WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs," Advances in Neural Information Processing Systems (NeurIPS 2024), Datasets and Benchmarks Track, vol. 37, Dec. 2024.
  22. Z. Lin, Z. Wang, Y. Tong, Y. Wang, Y. Guo, Y. Wang, and J. Shang, "ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation," Findings of the Association for Computational Linguistics: EMNLP 2023, pp. 4694-4702, Dec. 2023.
  23. T. Markov, C. Zhang, S. Agarwal, F. E. Nekoul, T. Lee, S. Adler, A. Jiang, and L. Weng, "A Holistic Approach to Undesired Content Detection in the Real World," Proceedings of the AAAI Conference on Artificial Intelligence, vol. 37, no. 12, pp. 15009-15018, Jun. 2023.
  24. X. Liu, P. Li, E. Suh, Y. Vorobeychik, Z. Mao, S. Jha, P. McDaniel, H. Sun, B. Li, and C. Xiao, "AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs," Proceedings of the 13th International Conference on Learning Representations (ICLR 2025), Apr. 2025.