DOI QR코드

DOI QR Code

LLM 기반 의미론적 특허 데이터 노이즈 필터링 방법론 연구

LLM-Based Semantic Noise Filtering Method for Patent Text Data

  • 임진성 (경상국립대학교 대학원 기술경영학과) ;
  • 송지훈 (경상국립대학교 대학원 기술경영학과)
  • Jin Seong Lim (Gyeongsang National University, Department of Management of Technology) ;
  • Chie Hoon Song (Gyeongsang National University, Department of Management of Technology)
  • 투고 : 2025.08.18
  • 심사 : 2025.10.14
  • 발행 : 2025.10.31

초록

Patent data are essential for tracking technological progress, assessing competitiveness, and forecasting future developments. However, the rapid evolution of technology and the rise of convergent fields make filtering irrelevant data a persistent challenge. Traditional statistical models and manual preprocessing by researchers require substantial time and effort, prompting continuous research on efficient information structuring. In particular, filtering methods based on statistics or keywords have limitations in fully capturing subtle technical nuances and complex contexts. To address these limitations, this study proposes a semantic noise filtering methodology for patent data leveraging the contextual understanding capabilities of large language models (LLMs). The approach integrates LLM-based classification, statistical stability analysis, and cross-LLM review procedures to enhance the consistency and reliability of the filtering results. Applied to 1,930 domestic patents in the bio-artificial organ domain from 2000 to 2024, the method identified 55.4% as noise. The results demonstrate the method's potential as an effective tool for technology policy formulation and strategic decision-making support.

키워드

1. 서론

정보의 관점에서 특허 데이터는 기술혁신 동향을 파악하고, 기술 경쟁 환경을 분석하며, 연구개발 전략을 수립하는 중요한 자원으로 작용한다[1]. 특히, 국가정책 개발 및 지역 혁신 생태계 구축에 있어 특허 데이터는 필수적인 역할을 수행한다. 많은 지자체에서 전략산업 육성을 위해 과학기술혁신역량을 측정하고 지역 경쟁력을 강화하는 데 특허 기반 지표를 핵심 자료로 활용한다[2]. 예를들어, 특허 출원 및 등록 데이터를 통해 특정 산업의 기술 성숙도를 평가하거나, 지역별 기술 클러스터의 강점을 파악함으로써 정책 우선순위를 설정할 수 있다. 이를 위해서는 분석에 유효한 특허만을 선별해 정제하는 과정이 필수적이며, 노이즈 특허를 걸러내고 핵심 기술 정보를 추출하는 기법이 병행되어야 한다. 다만, 특허 데이터의 방대한 양과 복잡성으로 인해, 데이터 획득 단계에서 분석 대상 기술 분야와 관련 없는 데이터, 즉 노이즈를 효과적으로 필터링하는 일은 여전히 해결해야 할 중요한 과제로 남아 있으며[3,4], 많은 연구에서 이 과정을 명시적으로 다루지 않거나 생략하는 경향이 있다.

실무에서는 관련 특허를 최대한 확보하기 위해 검색식을 폭넓게 설정하게 되며, 이로 인해 도출된 초기 특허 집합에는 상당수의 노이즈가 포함될 수 있다. 이에 대응하기 위해, 연구자들은 도메인 전문가와의 협업을 통해 수작업으로 노이즈 특허를 제거하는 방식을 사용해 왔다. 그러나 특허 출원량의 지속적인 증가와 기술 지식의 복잡성 심화로 이러한 수동 필터링은 시간 소모적이고 노동집약적으로 변하고 있으며, 분석의 효율성과 일관성을 저해하는 요인으로 작용하고 있다. 따라서 노이즈 특허를 자동으로 걸러내어 분석 대상 특허의 정확도를 높일 수 있는 지능형 필터링 기법의 필요성이 커지고 있다. 선행연구에서도 특허 노이즈 필터링이 전문가들이 본연의 고부가가치 업무에 집중할 수 있어 특허 분석 효율성을 높일 수 있다고 보고된 바 있다[5].

이러한 문제의식에 기반해, 본 연구는 LLM 기반의 의미론적 필터링 기법을 대안으로 제시하고자 한다. 지금까지는 통계적 기법이나 키워드 기반 규칙(예: 논리 연산자 적용)을 활용한 특허 노이즈 필터링 방법들이 주로 연구되어 왔다[6]. 예를 들어, LDA 기반 토픽 모델링을 통해 특허 문서의 잠재 토픽을 추론하여 관련성이 낮은 특허를 분류하거나, 특허의 정보 엔트로피와 도메인 포컬 키워드(focal keyword) 그룹을 이용해 특허 문서 간 유사도를 측정함으로써 노이즈 특허를 선별하는 절차가 제안된바 있다[5,7]. 그러나 이러한 기존 접근 방식은 기술 의미의 뉘앙스를 충분히 포착하기 어려우며, 복합적인 문맥 해석에는 한계가 있다. 이에 본 연구는 대규모 언어모델(LLM)의 문맥 이해 능력을 활용하여, 의미 기반의 특허 필터링 가능성을 실증적으로 검토하고자 한다. 무엇보다 LLM은 특허 문서를 내용상의 주제 분야에 따라 자동으로 분류하는 작업에서 우수한 성능을 보이는 것으로 보고되고 있어[8], 제안하는 LLM 기반 접근법이 기존 기법들의 한계를 보완하고 노이즈 특허 필터링의 정확성을 한층 높일 것으로 기대된다.

본 연구에서는 제안한 방법론을 사례 연구로서 바이오 인공장기(오르가노이드) 기술 분야의 특허 데이터에 적용해 그 효과를 검증하고자 한다. 바이오 인공장기는 생명공학, 줄기세포, 면역조절, 3D 바이오프린팅 등 첨단기술이 융합된 분야로, 기술의 급격한 발전으로 인해 중요성이 부각되고 있다[9]. 특히, 미국 식품의약국(FDA)이 기존의 동물실험을 단계적으로 폐지를 추진하고 있으며, 줄기세포로 배양해 만든 ‘오가노이드’로 뇌, 간, 신장 등 인체장기로 활용할 수 있는 연구들이 보고되고 있다. 인간의 기대수명이 증가함에 따라 해당 기술의 산업적 및 정책적 중요성이 크게 증가하고 있다[10].

본 논문의 구성은 다음과 같다. 제2장에서는 특허 노이즈 필터링과 생성형 AI를 활용한 정보 구조화 관련 선행연구를 리뷰한다. 제3장은 사용된 특허 데이터와 제안하는 노이즈 필터링 법론에 관해 기술한다. 제4장에서는 분석 결과를 제시하고 이에 대한 정량적 해석을 통해 제안 기법의 유효성을 평가한다. 마지막으로 제5장에서는 본 연구의 주요 시사점과 한계점을 논의하고, 향후 연구방향을 제안한다.

2. 선행연구

본 장에서는 특허 노이즈 필터링 관련 선행연구 및 생성형 AI를 활용해 정보를 구조화 및 필터링한 사례에 대해 고찰한다.

2.1 특허 노이즈 필터링 관련 연구

특허 데이터의 노이즈 필터링 문제를 다룬 선행 연구들은 주로 통계적, 어휘적, 규칙 기반 분석법을 활용해 진행되었다. 장청윤 외(2013)는 특허 검색어 단위에서 도출된 키워드와 복합명사를 조합해 효율적인 특허 검색어 추출 방법을 연구했다. 이를통해 검색 목적에 맞는 특허를 검색하는 데 필요한 시간을 단축하며, 목표로 하는 특허를 효율적으로 검색할 수 있었다[11]. Choi & Jun(2016)은 특허 빅데이터 분석에서 발생하는 노이즈와 이상치 문제를 해결하기 위해 데이터 평활(smoothing)과 상자그림(box plot)을 활용하는 방법론을 제안했다. 제안된 절차는 기술 키워드 기반의 시계열 데이터를 구조화한 뒤 이상값을 제거하고, 이를 분석에 반영하는 방식으로 구성된다. 실증 분석 결과, 노이즈 제거는 예측 정확도와 회귀 모형의 설명력을 유의미하게 개선하는 것으로 나타났다[12]. 김무진 외(2015)은 Shannon 엔트로피 기반 노이즈 특허 시드 추출과 LDA 기반 의미 유사도 분석을 결합한 노이즈 결정화 기법으로 노이즈 특허를 효율적으로 제거함으로써, 유효특허 정제에 소요되는 시간과 비용을 획기적으로 절감할 수 있음을 입증했다[7]. 강희섭⋅이승호(2012)는 특허맵 분석을 위한 데이터 구축 과정에서 필수적인 노이즈 특허 제거에 기반한 신뢰도 높은 기술수준 평가 방법을 제안했다. 논리 연산자를 활용한 자동화 기법을 통해 수작업 중심의 노이즈 제거 과정을 효율화하였으며, 정제된 특허 데이터를 기반으로 평균 청구항수, 특허 패밀리 사이즈(PFS), 특허당 인용도(CPP), 삼극특허 등을 활용한 균형적인 기술수준 평가를 수행하였다. 적용 결과, 노이즈 비율을 10% 미만으로 낮추는 동시에 분석 신뢰도를 향상시킬 수 있음을 확인하였다[4]. 이처럼 통계적 모델을 활용한 접근법은 사전에 정의된 통계 지표로 노이즈를 판별한다는 특징이 있으나, 임계값 설정이나 토픽 해석에 전문가 개입이 필요하여 완전한 자동화에는 한계가 있다.

2.2 생성형 AI 기반 정보 구조화

정보의 구조화는 비정형 또는 반정형 텍스트 데이터에서 특정 정보를 식별해 정형화된 형식으로 변환하는 과정으로, 우상준 외(2015)는 친환경 법령정보를 사업단계, 사용자, 사업유형, 주제, 소관 부처 등의 다양한 메타데이터를 활용하여 법령정보를 구조화하는 지능형 정보 검색 방안을 제안했다[13]. 하지만, 수동적인 패턴 매칭 방식은 새로운 유형의 데이터를 효과적으로 처리하는 데 한계가 있었으며, 이에 따라 인공지능 기법을 활용한 연구들이 등장하기 시작하였다[14]. Srinivas 외(2024)는 생성형 AI 기반 분석 프레임워크(PatExpert)를 활용하여 특허 분류, 등록 가능성 평가, 청구항 생성, 추상적 요약, 다중 특허 분석 등 구조화를 통한 자동화 분류하는 것을 언어모델로 활용하는 방안을 제안했다[8]. 조석주⋅박상성(2024)은 LLM을 활용한 특허 서지정보 분석을 통해 보다 객관적이고 편향되지 않은 특허평가등급을 부여할 수 있는 최적의 모형을 제안했다[15]. 이와 같은 연구 흐름에 기초해, 생성형 AI 기반 정보 구조화는 데이터의 노이즈 문제를 해결하고 도출 결과의 정밀도를 향상시키는 유망한 방법으로 평가된다. 본 연구는 단어 빈도나 통계적 분석에 의존하는 전통적 기법에서 벗어나, 생성형 AI의 의미론적 수준에서의 필터링을 통해, 바이오 인공장기(오르가노이드) 기술을 바탕으로 타당성과 적용 가능성을 분석하고자 한다.

3. 데이터 및 연구 방법론

본 연구는 Fig. 1에 제시된 4단계의 분석 프로세스를 따라 수행되었다. 본 장에서는 분석에 활용된 데이터셋의 구성과 전처리 과정, 그리고 제안된 의미론적 노이즈 필터링 기법의 절차를 중심으로 연구 방법론을 상세히 기술한다.

SOOOB6_2025_v28n5_2_1379_4_f0001.png 이미지

Fig. 1. Schematic representation of the analysis process.

3.1 특허 데이터 수집 및 전처리

연구 대상 기술 분야는 바이오 인공장기(오르가노이드) 기술로, 최근 FDA가 이를 동물실험의 대체 수단으로 공식 인정함에 따라, 산업적⋅정책적 중요성이 급격히 부각되고 있는 영역이다. 본 연구에서는 해당 기술군과 관련된 특허 데이터를 수집하기 위해, 키워드 기반 논리 연산자를 활용한 검색식을 구성했다. 이는 기술 분야 포괄성을 극대화하는 데 목적이 있으며, 그 결과 해당 기술과 관련성이 다소 낮은 노이즈 특허도 함께 수집되었다. 이러한 특성으로 인해 수집된 초기 특허 집합에는 상당수의 비관련 특허가 포함되어 있으며, 이로부터 실제 분석에 적합한 관련 특허만을 선별해 내는 정제 절차가 필수적으로 요구된다. 특허 데이터는 Table 1에 명시된 검색식을 바탕으로 수집했다. 국내 특허청에 출원되어 등록 또는 공개된 특허 데이터를 온라인 특허 검색서비스 WIPSON을 통해 2024년 7월 확보했다. 전처리 과정에서 중복되는 엔트리 또는 특허 초록 및 분류코드에 결측치가 있는 데이터는 모두 제외했다. 최종적으로 1,930건에 달하는 정제된 데이터를 확보했다.

Table 1. Patent search query

SOOOB6_2025_v28n5_2_1379_5_t0001.png 이미지

3.2 Ground truth 데이터 구축

본 분석 단계에서는 LLM 기반 의미론적 필터링의 정확도를 검증하기 위해, 전문가 검토를 통해 분석 대상 특허에 대해 ‘관련 있음’ 또는 ‘관련 없음’의 이진 레이블을 수작업으로 부여하였다. 이렇게 처리된 ground truth 데이터는 노이즈 필터링 정확도 평가의 기준(reference) 데이터셋으로 활용된다. Ground truth 구축에 있어 바이오 인공장기와 직접적인 연관성이 적은 주변기술(예: 암치료용 배양재료⋅기술, 배양장치)은 대상 특허 범주에서 제외했다. 아울러, 분석의 신뢰도를 제고하기 위해 LLM 통계적 안정성 분석(Statistical Stability Analysis)과 교차 LLM 검토(Cross-LLM Review) 절차를 도입했다. 통계적 안정성 분석은 동일 모델을 동일 조건에서 반복 실행해 도출된 결과와 참조 결과 간의 일치도를 통계적으로 측정함으로써, 내부 응답의 일관성과 안정성을 평가하는 데 활용된다. 교차 LLM 검토는 서로 다른 LLM 간 응답을 비교해 판단 일관성을 평가하며, 단일 모델에 의존하는 분석 결과의 편향 가능성을 보완하고자 한다. 이들은 특허 노이즈 필터링 이후 적용되며, 정량적 평가뿐만 아니라 분석 결과의 신뢰성을 확보하기 위한 보조적 검증 수단으로 기능한다.

3.3 LLM 기반 특허 노이즈 필터링

본 분석 단계에서는 LLM을 활용해 각 특허의 “명칭(title)” 및 “초록(abstract)” 정보를 통합 입력으로 구성한 뒤, 해당 특허가 바이오 인공장기 기술과 의미론적으로 관련이 있는지를 평가했다. 이를 위해 Fig. 2에 제시된 프롬프트를 기반으로 LLM에게 판단을 요청했으며, Meta에서 개발한 Llama-3.3-70B-Instruct 모델을 적용했다.

SOOOB6_2025_v28n5_2_1379_5_f0001.png 이미지

Fig. 2. Prompt used to filter out noise patent data.

해당 프롬프트는 LLM이 특허 분석 전문가의 역할을 수행하도록 설정하고, ‘Yes’ 또는 ‘No’의 이진 분류만을 출력하도록 엄격히 지시함으로써 응답의 일관성과 정밀도를 제고하고자 했다. System prompt에서는 모델이 생명공학 및 오르가노이드 기술 분야에 전문성을 갖춘 특허 분석가의 역할을 수행하도록 지시하였다. User prompt에서는 특허 초록을 해석한 후, 해당 특허가 오르가노이드, 오르가노이드 배양, 오르가노이드 기반 기술에 명확히 관련이 있는지 여부를 판단하도록 구성되어 있다. 응답 형식은 단 하나의 단어(‘Yes’ 또는 ‘No’)로 제한되며, 그 외의 부가적인 설명, 문장, 기호 등은 허용되지 않는다. 또한, 애매한 경우에도 최선의 해석에 따라 반드시 판단을 내려야 하며, 이는 노이즈 판단 과정의 자동화 및 신뢰성 확보를 위한 설계 요소이다. 이러한 프롬프트 설계는 LLM의 자유로운 서술 응답 경향을 통제하고, 정량적 성능 비교에 적합한 이진 응답 출력을 유도하는 데 목적이 있다. 나아가, 3.2장에서 제시한 통계적 안정성 분석과 교차 LLM 검토를 통해 결과의 일관성과 신뢰성을 추가적으로 확보하고자 했다. 교차 LLM 검토에는 LG에서 개발한 Exaone-3.5-32B-Instruct 모델과 추론 특화 모델인 Exaone-Deep-32B가 활용되었다. 모든 모델은 Together AI의 API를 통해 호출하였다.

3.4 노이즈 필터링에 따른 특허 데이터 분석

본 분석 단계에서는 LLM 기반 노이즈 필터링 기법의 적용 전후를 비교해, 특허 데이터의 구성 변화와 정제 효과를 검토했다. Ground truth 데이터를 기준으로 필터링의 정확도를 평가했으며, 제안한 방법론의 효과성을 분석했다. 특히, 정제 전후의 특허 수, 기술 분류의 집중도 및 여러 기술지표의 변화 양상을 종합적으로 비교했다. 주요 정량지표로는 평균 패밀리 국가 수, 평균 피인용 횟수, 법적 상태(유효 등록 비율), 청구항 수, 기술성장률(CAGR)을 활용하였다[16]. 아울러, 주요 기술 분류 체계인 CPC 코드의 분포 변화도 함께 분석하여 필터링이 기술 범위에 미친 영향을 확인했다. 이러한 비교 분석은 노이즈 제거를 통해 특허 데이터가 얼마나 더 명확하고 분석 가능성 높은 형태로 정제되었는지를 평가하는 데 목적이 있다. Table 2는 본 연구에서 활용된 특허 지표의 정의와 해석 관점을 요약해 나타낸다.

Table 2. Variables used in the comparative analysis.

SOOOB6_2025_v28n5_2_1379_6_t0001.png 이미지

4. 연구 결과

4.1 기술통계

본 장에서는 분석에 활용된 특허 데이터의 특성을 보다 명확하게 파악하기 위한 기술통계를 제시한다. 기술통계는 일차적으로 노이즈 필터링을 거치지 않은 형태의 원시 데이터를 기준으로 산출되며, 이는 데이터의 기본 구조와 특성을 파악하는 데 목적이 있다. 이를 통해 이후 분석 단계에서 필터링이 데이터 구성에 미친 영향을 더 정교하게 해석할 수 있는 기반을 마련한다. 기술통계에는 연간 특허 출원 추이, 특허 품질 관련 지표, 법적 상태, 공동 출원 비율, 기술 분류 분포, 주요 출원인 순위 등 주요 구조적 특성이 포함된다. Fig. 3은 연도별 출원 추이를 시각화해 나타낸다.

SOOOB6_2025_v28n5_2_1379_7_f0001.png 이미지

Fig. 3. Patent application trend of raw data.

그 결과, 바이오 인공장기 관련 특허의 연구는 2015년 이후부터 급격한 증가세를 보였으며, 2022년에 정점을 기록한 것으로 나타난다. 이는 바이오인공장기 기술에 대한 산업적 관심이 최근 몇 년 간 집중되었음을 시사한다. 2024년 이후의 급격한 감소는 데이터 수집 시점을 기준으로 한 특허 공개의 지연 효과에 기인한 것으로 해석된다. 전반적으로 2000년대 초반에는 출원 건수가 낮았으나, 이후 지속적인 성장세를 보여 향후 기술의 성숙과 시장 확대 가능성을 뒷받침한다. Table 3은 주요 지표에 대한 기술통계 결과값을 정리해 나타낸다. 이는 추후 필터링 이후의 데이터와 비교해, 노이즈 제거가 데이터 구성과 품질에 미친 영향을 정량적으로 평가하는 데 활용된다. 기술 성장률은 2010년부터 2023년까지의 출원량을 기반으로 CAGR 방식에 따라 산출되었으며, 법적 상태는 총 1,930건의 특허를 기준으로 등록 및 심사 중인 상태의 비율로 구분해 제시했다. 공동 출원은 2개 이상의 독립적인 출원인이 동일 특허에 공동으로 참여한 사례를 기준으로 산정했다.

Table 3. Key variables and their summary statistics.

SOOOB6_2025_v28n5_2_1379_7_t0001.png 이미지

Table 4는 특허의 CPC 코드를 기준으로 등장 빈도가 높은 상위 10개 항목을 정리해 나타낸다. 이를 통해 바이오 인공장기 기술군 내 주요 기술 영역의 분포가 어떠한 특성을 보이는지 확인할 수 있다. CPC 코드는 “서브 클래스” 수준에서 분류된 항목을 기준으로 분석했다. 그 결과 A61L-0027({이식편 또는} 보철물 또는 {이식편 또는} 보철물에 코팅을 하기 위한 재료), C12N-2513(3차원 배양)과 C12N-0005(인체, 동물 또는 식물의 미분화 세포, 예. 세포주; 조직; 그것의 배양 또는 유지; 그것의 배지)가 기술군 내 핵심 기술로 작용하고 있음을 확인했다. 다만, A61L-0027의 바이오 인공장기와의 직접적인 연관성이 상대적으로 낮아, 분석 시 해당 항목의 기술적 범위를 면밀히 검토 할 필요가 있다.

Table 4. CPC code counts (Top 10).

SOOOB6_2025_v28n5_2_1379_7_t0002.png 이미지

Table 5는 출원 빈도를 기준으로 산정한 상위 10개 주요 출원인을 정리해 제시한다. 대부분 대학 및 연구기관이 상위를 차지하고 있으며, “주식회사 삼인공간정보”의 경우, 검색식에서 사용된 “3D”, “3차원” 키워드로 인해 추출되었으나, 바이오⋅의약품 분야와 관련이 없으며 측량⋅지도 제작 등 공간정보산업 분야를 기반으로 한 출원으로 파악되었다.

Table 5. Top 10 applicants.

SOOOB6_2025_v28n5_2_1379_8_t0001.png 이미지

4.2 노이즈 필터링 비교 결과

본 장에서는 전문가 검토를 통해 구성한 ground truth 데이터와 노이즈 필터링을 통해 도출된 결과를 비교해 정리했다. 기준 모델인 Llama-3.3-70B-Instruct를 활용한 결과 1,070건의 특허가 노이즈로 분류되었으며 이는 전체 데이터의 약 55.4%에 해당한다. Ground truth 기준으로는 노이즈에 해당하지 않는 특허의 비중은 67.7%(1,307건)였으며, LLM 기반 노이즈 분류와의 일치율(정확도)은 89.4%로 나타났다. 이어서 정밀도(precision), 재현율(recall), F1-score를 산출한 결과, 정밀도는 94.93%, 재현율은 80.58%, F1-score는 87.17%로 집계되었다. 정밀도가 상대적으로 높다는 것은 LLM이 “관련 있음”으로 분류한 특허 중 실제로도 관련 있는 특허의 비율이 높았음을 의미한다. 이는 필터링 결과의 신뢰도가 높고, 후속 분석에서 노이즈가 포함될 가능성이 낮다는 점에서 중요한 시사점을 제공한다. Table 6은 노이즈 필터링 결과의 일관성과 신뢰성을 분석하기 위해 수행한 통계적 안정성 분석과 교차 LLM 검토 결과를 정리한 것이다. 두 검증 절차는 모델 내부 판단의 안정성과 모델 간 판단의 일관성을 평가하기 위해 활용되었다. 이를 통해 제안한 접근법의 정량적 신뢰도와 적용 가능성을 다각도로 검토했다. 아울러, 모델별 처리에 소요된 시간도 함께 기록하여 실질적인 분석 효율성을 비교할 수 있도록 했다. 교차 LLM 검토(1)은 Exaone-3.5-32B-Instruct, 교차 LLM, 검토(2)는 Exaone-Deep-32B를 의미한다. 그 결과, 통계적 안정성은 높게 나타났으며, 추론형 모델보다는 Instruct 모델과의 일치도가 소폭이지만 더 높게 관찰되었다.

Table 6. Comparative analysis of LLM output.

SOOOB6_2025_v28n5_2_1379_8_t0002.png 이미지

Table 7은 모델별 노이즈 필터링에 소요된 시간을 초단위로 나타낸다. 각 모델에 대해 동일한 데이터셋을 대상으로 세 차례 측정한 결과, 평균 처리 시간은 Llama-3.3 모델이 가장 길었고, 그 다음으로 Exaone-3.5-32B-Instruct 모델과 Exaone-Deep-32B 모델 순으로 나타났다. 이러한 결과는 모델 크기의 차이가 처리 효율성에 크게 영향을 미침을 시사한다. 또한, 추론형의 경우 Instruct 모델 대비 약 10배 이상의 속도 차이를 보였기에, 속도가 중요한 분석 환경에서는 더 적은 파라미터를 갖는 모델의 적용이 유리함을 보여준다.

Table 7. Processing time for generating noise-filtered output.

SOOOB6_2025_v28n5_2_1379_9_t0001.png 이미지

4.3 노이즈 필터링 후 특허 데이터 분석 결과

본 장에서는 LLM 기반 노이즈 필터링을 통해 “관련 있음”으로 분류된 특허 데이터만을 대상으로 분석을 수행했다. Llama-3.3-70B 모델 결과를 기준으로 총 860건의 특허가 분석에 포함되었다. Fig. 4는 연도별 출원 추이를 나타낸 것으로, 바이오 오르가노이드 관련 특허는 최근 10년 사이 가파른 성장세를 보였다. 노이즈 필터링 이후에도 전반적인 경향에는 큰 변화가 없었으며, 필터링 과정이 장기적인 추세 분석에 미치는 영향은 제한적인 것으로 판단된다.

SOOOB6_2025_v28n5_2_1379_9_f0001.png 이미지

Fig. 4. Patent application trend of noise-filtered patent data.

Table 8은 필터링된 특허 데이터에 대한 기술통계 결과값을 정리한 것이다. 필터링 전 데이터를 기반으로 산출한 Table 3과 비교하면, 평균 피인용 횟수는 1.877에서 1.449로 감소하였다. 평균 패밀리 국가 수는 3.684에서 3.662로 소폭 줄었으며, 평균 청구항 수는 13.546에서 14.957로 증가하였다. 기술 성장률은 22.10%에서 27.49%로 상승하여, 필터링 후 데이터가 상대적으로 최근 기술에 집중되는 경향을 보였다. 법적 상태 중 ‘등록’ 비율은 47.6%로 유사했으며, ‘심사 중’ 비율은 19.6%에서 27.6%로 상승했다. 공동 출원 비율의 경우 17.1%로 소폭 변동했다. 이러한 필터링 과정을 거침으로써 비관련 특허로 인해 발생할 수 있는 분석 왜곡을 최소화하고, 기술 동향 및 지표 해석의 신뢰성을 한층 강화했다고 볼 수 있다.

Table 8. Summary statistics of key variables for the filtered patent data set.

SOOOB6_2025_v28n5_2_1379_9_t0002.png 이미지

Table 9는 노이즈 필터링을 거친 특허 데이터의 상위 10개 CPC 코드를 제시한 것으로, 필터링 전 데이터를 기반으로 한 Table 4와 비교 시 몇 가지 주목할 만한 변화가 확인되었다. 먼저, Table 4에 포함되어 있던 A61F-0002(혈관에 이식할 수 있는 필터; 보철물)는 필터링 이후 목록에서 제외되었으며, 대신 C12M-0023(미생물학을 위한 장치)이 새롭게 포함되었다. 공통적으로 나타난 CPC 코드의 빈도수는 전반적으로 감소하였으며, 특히 A61L-0027은 1,262건에서 517건으로 크게 줄어 순위가 1위에서 3위로 하락했다. 반면, C12N-0005는 1,084건에서 972건으로 감소하였음에도 상대적으로 높은 비중을 유지하며 순위가 2위에서 1위로 상승하였다. 이러한 변화는 노이즈 제거를 통해 오르가노이드와의 직접적인 관련성이 낮은 기술군이 상위권에서 배제되고, 세포배양 등 핵심 기술군의 상대적 비중이 강화되었음을 시사한다.

Table 9. Top 10 CPC code counts of noise‑filtered patent data.

SOOOB6_2025_v28n5_2_1379_10_t0001.png 이미지

Table 10에 따르면, “오르가노이드사이언스”와 “주식회사 세라트젠”과 같이 오르가노이드 관련 기업이 상위권으로 새롭게 진입했다. 상위 10위권에는 이들 기업 외에도 주요 대학 산학협력단과 한국화학연구원, 한국생명공학연구원, 울산과학기술원 등 주요 연구기관이 포함되어 있다. 이는 필터링 이후 데이터셋에서 산업계와 학계가 모두 활발하게 활동하고 있음을 보여준다. 또한, 학계 중심이었던 상위권 구조가 산업계와 보다 균형을 이루는 형태로 변화하였다. Spearman 순위상관계수를 바탕으로 Table 5와 Table 10간의 순위 유사성은 0.495로 나타나, 필터링 전⋅후 상위 출원인 순위에 일정 수준의 변동이 있었음을 시사한다.

Table 10. Top 10 applicants of noise-filtered patent data.

SOOOB6_2025_v28n5_2_1379_10_t0002.png 이미지

이러한 순위 변동은 노이즈 필터링이 데이터 왜곡을 최소화하는 데 실질적으로 기여할 수 있음을 보여준다. 즉, 관련성이 낮은 특허를 배제함으로써 분석 결과가 실제 기술 활동을 더 정확하게 반영하도록 한다. 이는 후속 기술 동향 분석 및 정책적 함의 도출의 타당성과 신뢰성을 제고하는 기반으로 작용한다.

5. 결론

특허 데이터 분석은 기술 동향 파악, 경쟁 환경 분석, 연구개발 전략 수립 등 다양한 R&D 의사결정 과정에서 중요한 역할을 수행 한다. 그러나 LLM을 적용한 데이터 노이즈 필터링에 관한 연구는 아직 상대적으로 제한적이다. 데이터 노이즈 필터링은 내적 타당도와 해석력을 유지하기 위한 핵심 절차로, 추세⋅품질⋅구조적 분석 모두에서 실제 유용한 신호(signal)만을 보존하도록 한다. 본 연구는 ground truth 데이터 구축, 통계적 안정성 분석, 교차 LLM 검토로 이어지는 단계적 접근을 통해 특허 노이즈 필터링의 효과를 정량적으로 검증했다. Llama-3.3-70B 모델은 처리 시간이 길지만 높은 분류 정밀도를 보여, 활용 목적에 따라 속도와 정확도 간 균형을 고려한 모델 선택 전략이 요구된다. 본 연구의 의의는 LLM 기반 필터링의 정확도뿐 아니라 처리 시간을 함께 분석하여 실무적 의사결정에 유용한 기준을 제시했다는 점에 있다. 한계로는 ground truth 데이터 구축 과정에서 여전히 전문가의 수작업이 요구된다는 점이 있으며, 이를 대체 또는 보완할 수 있는 알고리즘 및 학습지도 기법의 개발이 요구된다. 또한 LLM 모델의 성능은 기술 분야와 데이터셋에 따라 달라질 수 있으므로, 다양한 도메인에 대한 일반화 가능성과 견고성(robustness)을 추가적으로 검증할 필요가 있다. 정책적 및 실무적 측면에서 본 연구의 방법론은 국가 차원의 전략산업 육성의 전방단계에서 정제된 데이터에 기반한 고신뢰 분석 체계 구축에 기여할 수 있을 것으로 기대한다.

참고문헌

  1. 조용래, 김의석, 특허 네트워크와 전략지표 분석을 통한 기업 기술융합 전략 연구, 지식재산연구, 9(4), pp.191-221, (2014). https://doi.org/10.34122/jip.2014.12.9.4.191
  2. 김태운, 창조경제 패러다임에서의 지방과학기술정책의 개선방향: 대구⋅경북의 사례 중심으로, 한국경제지리학회지, 17(1), pp.45-68, (2014). https://doi.org/10.23841/EGSK.2014.17.1.45
  3. 김영호, 박상성, 장동식, 효율적인 특허정보 조사를 위한 분류 모형, 디지털산업정보학회, 15(4), pp.103-110, (2019). https://doi.org/10.17662/KSDIM.2019.15.4.103
  4. 강희섭, 이승호, 특허 데이터 분석시 효율적인 노이즈 제거와 신뢰도가 향상된 특허 기술수준 평가에 관한 연구, 기술혁신학회지, 15(1), pp.105-128, (2012).
  5. Yoon, J., Jeong, B., Kim, M., Lee, C., An information entropy and latent Dirichlet allocation approach to noise patent filtering, Advanced Engineering Informatics, 47, 101243, pp.1-11, (2021). https://doi.org/10.1016/j.aei.2020.101243
  6. 이우기, 송종기, 강민구, 키워드 분포를 고려한 효과적 특허검색기법, 정보화연구, 9(3), pp.323-331, (2012).
  7. 김무진, 윤장혁, 최덕용, 경진영, 노이즈 결정화 방식을 이용한 특허 노이즈 필터링 방법, 대한산업공학회 춘계공동학술대회 논문집, pp.563-567, (2015).
  8. Srinivas, S. S., Vaikunth, V. S., Runkana, V. Towards automated patent workflows: ai-orchestrated multi-agent framework for intellectual property management and analysis, arXiv preprint arXiv:2409.19006., pp.1-16, (2024).
  9. Kim, J., Koo, B. K., Knoblich, J. A., Human organoids: model systems for human biology and medicine. Nature reviews Molecular cell biology, 21(10), pp.571-584, (2020). https://doi.org/10.1038/s41580-020-0259-3
  10. 전수연, 이성인, 안선주, 권다연, 박지혜, 오가노이드를 이용한 동물대체시험법 표준동향과 전망, 표준인증안전학회지, 14(1), pp.59-75, (2024). https://doi.org/10.34139/JSCS.2024.14.1.59
  11. 장청윤, 장정환, 김석주, 이현근, 이창호, 빅데이터 분석 도구 R을 활용한 효율적인 특허 검색에 관한 연구, 대한안전경영과학회지, 15(4), pp.289-294, (2013). https://doi.org/10.12812/KSMS.2013.15.4.289
  12. Choi, J., Jun, S., Big Data Smoothing and Outlier Removal for Patent Big Data Analysis, Journal of The Korea Society of Computer and Information, 21(8), pp.77-84, (2016). https://doi.org/10.9708/jksci.2016.21.8.077
  13. 우상준, 오민호, 김한수, 이재욱, 메타데이터기반 정보구조화를 통한 지능형 친환경 법령정보 검색, 한국 BIM 학회논문집, 5(1), pp.8-15, (2015). https://doi.org/10.13161/kibim.2015.5.1.008
  14. Grishman, R., Twenty-five years of information extraction, Natural Language Engineering, 25(6), pp.677-692, (2019). https://doi.org/10.1017/S1351324919000512
  15. 조석주, 박상성, LLM을 이용한 최적 특허빅데이터분석 모형 분석, 한국지능시스템학회 논문지, 34(5), pp.373-377, (2024). https://doi.org/10.5391/JKIIS.2024.34.5.373
  16. 윤정연, 류태규, 윤장혁, IP 포트폴리오의 특성분석을 위한 특허지표 개발에 대한 연구, 정보관리연구, 43(2), pp. 67-83, (2012). https://doi.org/10.1633/JIM.2012.43.2.067