김다인(Kim, Dain)1iD
정수민(Jung, Sumin)2
박민건(Park, Mingeon)3
허태민(Heo, Taemin)4†iD
-
정회원 · 연세대학교 건설환경공학과 석사과정
(Yonsei University · dain1120@g.hongik.ac.kr)
-
홍익대학교 건설환경공학과 학사과정
(Hongik University · j_soomin12@naver.com)
-
홍익대학교 건설환경공학과 학사과정
(Hongik University· mingeonpark10@gmail.com)
-
종신회원 · 교신저자 · 홍익대학교 건설환경공학과 조교수, 공학박사
(Corresponding Author · Hongik University · taemin@hongik.ac.kr)
Copyright 2026 by the Korean Society of Civil Engineers
핵심용어
교량 유지관리, 안전등급 예측, 랜덤 포레스트, Retrieval-Augmented Generation, 점검 이력, 의사결정지원
Keywords
Bridge maintenance, Safety grade prediction, Random Forest, Retrieval-Augmented Generation, Inspection history, Decision support
1. 서 론
1.1 연구 배경 및 필요성
최근 국내 사회 기반 시설 중 교량의 노후화가 빠르게 진행되며 유지관리의 중요성이 점차 강조되고 있다(Han et al., 2025). 국토교통부 전국 교량 표준 데이터에 따르면, 2035년에는 공용연수 30년 이상 교량이 전체 교량의 약 57.8 %에 이를 것으로 전망되며, 이는
향후 보수·보강 및 점검 수요의 급격한 증가를 의미한다. 현행 시설물안전법은 교량을 규모 및 관리 난이도에 따라 1·2·3종으로 구분하고 모든 교량에
대해 반기 1회 이상의 정기점검을 의무화하고 있으나(MOLIT, 2021a;
MOLIT, 2021b), 2024년 기준 전국 35,902개 교량 수에 비해 전문 관리 인력과 예산은 구조적으로 제한되어 있다(Ratner, 2009;
MOLIT, 2021b). 또한 교량의 LCC(Life Cycle Cost) 관점에서 제한된 예산 하에서 효율적인 교량 관리를 위해서 위험도가 높은 교량을 우선적으로 선별하고
점검 우선순위를 합리적으로 설정하는 것이 요구된다(Hwang et al., 2021). 따라서 관리자의 경험에 의존하지 않으면서도 위험 가능성이 높은 교량을 선제적으로 식별할 수 있는 의사결정 지원 체계가 요구된다.
기존 교량 관리 체계에서는 열화 예측 모델을 BMS(Bridge Management System)에 통합해 왔다. 교량 열화 예측 연구는 초기의 분류·회귀
트리 기반 기계학습 모델(Bektas et al., 2013)에서 비선형 열화 특성을 학습하기 위한 인공신경망(Althaqafi and Chou, 2022), 나아가 시간적 점진성을 반영한 시계열 예측 모델(Miao et al., 2023)로 발전해 왔다. Souza et al.(2024)은 전 세계 BMS를 분석한 결과, 약 67 %의 시스템이 열화 예측 모델을 활용하고 있으며, 열화 예측이 BMS 내에서 주로 독립적인 분석 모듈로
활용될 뿐, 실제 유지관리 의사결정 단계와 충분히 통합되지 못하고 있음을 지적하였다. 즉, 열화 예측 모델은 위험을 정량화 하는 데에 기여하지만,
점검 및 보수 우선순위를 결정하는 실질적인 판단을 제공하지는 못하는 한계를 가진다.
Brighenti et al.(2024)은 BMS를 데이터 관리, 진단, 예측, 의사결정의 네 가지 핵심 모듈로 구분하며, 기존 연구와 실무 시스템이 진단 및 예측 단계에 편중되어 있는
반면 의사결정 모듈은 정의와 구현이 모두 부족하다고 지적하였다. 이는 교량의 효과적인 유지관리를 위하여 상태 평가의 높은 예측 정확도뿐만 아니라,
제한된 자원 조건에서 어떠한 교량을 언제, 어떻게 관리할 것인가에 대한 판단을 지원하는 체계의 필요성을 보여준다. 따라서 본 연구는 기존 연구에서
분리되어 다루어져 온 예측 모듈과 의사결정 모듈 간의 단절을 직접적으로 해소하고자 한다. 단순히 안전등급 예측 모델과 검색 기반 시스템을 병렬적으로
결합하는 것이 아니라, 위험 교량 예측, 관련 점검 이력 및 유사 사례 검색, 유지관리 맥락 기반 응답 제공으로 이어지는 순차적 워크플로우를 설계함으로써,
예측 결과가 실제 유지관리 판단 과정에 활용될 수 있도록 지원하는 프레임워크를 제안한다.
최근 생성형 AI를 활용하여 자유형식의 교량 점검 보고서의 결함 유형, 위치, 부재 정보 등을 바탕으로 검색 및 추론하는 연구가 제시되었다(Omar and Moselhi, 2026). Baek et al.(2025)은 대규모 사고사례에서 유사 사례를 검색하고 이를 바탕으로 현장의 안전관리 지침을 형성하는 RAG(Retrieval-Augmented Generation)
기반 프레임워크를 제시하였다. 이는 건설 도메인에서 관리자의 의존 없이 신뢰할 수 있는 RAG의 활용 가능성을 증명했다. RAG 시스템의 성능은 입력
문서의 구조화 수준과 일관성에 크게 의존하며, 잘 정돈된 보고서일수록 문맥 관련성과 답변 충실성이 유의미하게 향상된다(Iaroshev et al., 2024). 즉, 비정형 점검 기록을 구조화한 데이터베이스로 구축할 경우, 이를 기반으로 한 RAG 프레임워크에서 유사 사례 검색과 맥락 제공의 성능을 확보할
수 있음을 시사한다. 교량의 유지관리 데이터는 교량명, 손상 유형, 보수 이력, 점검자 등이 복잡하게 얽혀있는 비정형 시계열 기록의 특성을 가진다.
특히, 점검 정보는 시간 순으로 축적되며 동일 교량 내에서도 점검 시점별 맥락이 상이하기 때문에, 단순 문서 단위 검색만으로는 충분한 의미적 연속성을
확보하기 어렵다. 따라서 교량 정보 구조화와 시간 이력 기반 유지관리 맥락을 고려한 도메인 맞춤형 RAG 파이프라인의 개발이 필요하다.
위 선행 연구를 토대로 본 연구는 교량 유지관리 의사결정을 지원하기 위한 이중 단계 접근법을 제안한다. 먼저, 구조적 특성과 환경적 특성을 통합한
전통적 기계학습 모델들(의사결정 나무(Decision Tree), 랜덤 포레스트(Random Forest), XGBoost(eXtreme Gradient
Boosting))을 활용하여 교량의 안전등급을 예측한다. 이 과정에서 대규모 교량 자산의 통계적 패턴을 학습하여 안전등급이 낮게 변화할 가능성이
큰 위험 교량을 사전에 선별한다. 안전등급 만을 예측하는 모델은 어떠한 손상 이력이나 구조적 맥락에 의해 도출되었는지에 대한 설명을 제공하지 못하는
한계를 지닌다. 또한, 교량 점검 이력은 시간에 따라 누적되는 특성을 가지므로, 단일 시점의 수치 기반 예측만으로는 손상 진행 양상이나 등급 변화의
배경을 충분히 반영하기 어렵다. 이를 극복하기 위하여, RAG 프레임워크를 구축하여, 안전등급 예측 결과와 과거 점검 이력, 유지관리 기록 기반 점검
맥락을 함께 제공함으로써 관리자의 판단을 보조한다. 이를 통해, 개별 예측 모델의 정합성을 비교하는 것을 뛰어넘어, 예측 결과를 점검자의 판단 과정과
유기적으로 연결하여 확장하는 것을 목표로 한다. 구조적 특성 중심의 기존 교량 열화 예측 연구를 일반화된 점검 특성 중심으로 확장하고, 예측과 해석,
그리고 의사결정 지원을 결합한 통합적 유지관리 프레임워크를 제시함으로써, 제한된 관리 자원 하에서 보다 효율적이고 합리적인 교량 유지관리 전략 수립에
기여하고자 한다.
Fig. 1. Integrated Framework for Bridge Safety Grade Prediction and Maintenance History-Based RAG Decision Support
1.2 연구 범위
본 연구는 제한된 유지관리 자원 환경에서 교량 위험 예측과 유지관리 맥락 제공을 결합한 의사결정 지원 프레임워크의 적용 가능성을 검증하는 데 초점을
두었기 때문에 다음과 같은 연구 범위와 한계를 가진다.
첫째, 본 연구는 데이터 결합 과정에서 변수의 일관성과 관리 체계의 동질성을 확보하기 위하여 분석 대상을 일반국도 교량으로 한정하였다. 교량 유지관리
체계는 도로 교량 유형에 따라 관리 주체, 점검 빈도, 유지관리 우선순위 및 예산 배분 방식이 상이하므로, 데이터 편차가 확대될 가능성이 존재한다.
이에 따라 본 연구는 전국 교량 표준데이터 중 일반국도 교량을 중심으로 분석을 수행하였으며, 지방도 및 국지도 등 관리 체계가 상이한 교량에 동일한
모델을 적용할 경우 성능 일반화에는 한계가 존재할 수 있다. 향후 연구에서는 다양한 도로 체계를 포함한 데이터 확장을 통해 모델의 적용 가능성을 검증할
필요가 있다.
둘째, 본 연구에서 사용된 변수는 정밀안전진단 보고서 수준의 직접 측정값이 아닌 범용적으로 확보 가능한 점검 기록 공개 원본 데이터에 기반한다는 한계를
가진다. 데이터에는 염해, 탄산화 등 열화 메커니즘과 관련된 직접 측정 변수가 포함되어 있지 않으며, 이러한 정보는 일반적으로 정밀안전진단 수행 교량에서만
확보 가능하다. 따라서 본 연구는 실제 유지관리 실무에서 광범위하게 확보 가능한 변수만으로 실용적인 위험 예측이 가능한지를 검증하는 데 초점을 두었다.
따라서 열화 가능성을 간접적으로 반영하는 대리 변수로 활용하였다. 즉, 직접 측정 변수의 부재는 예측 정밀도의 한계로 작용할 수 있으나, 동시에 대규모
교량 자산에 적용 가능한 현실적 데이터 환경을 반영한 연구 범위로 볼 수 있다.
셋째, 공개된 교량 안전등급 데이터 내 D등급 및 E등급 교량은 표본 수가 극히 제한적이어서 학습 과정에서 제외되었다. 이는 극단적 위험 교량에 대한
예측 성능을 직접 검증하지 못하였다는 한계를 가진다. 실제 유지관리 환경에서 D·E등급 교량은 이미 집중 관리 대상으로 분류되는 반면, 중간 위험
수준의 교량은 제한된 인력과 예산 조건에서 우선순위 설정 과정에서 누락될 가능성이 존재한다. 따라서 본 연구는 점검 우선순위 설정을 지원하기 위한
실무적 활용 가능성에 초점을 두었다. 즉, 본 연구의 1차적 목적은 이미 긴급보수 대상으로 관리되고 있는 D·E등급 교량을 재확인하는 데 있는 것이
아니라, 상대적으로 관리 우선순위에서 간과될 수 있는 A·B등급 내 잠재적 C등급 교량을 조기에 선별하는 데 있다.
넷째, 본 연구는 안전등급 예측–검색–의사결정 지원을 통합하는 프레임워크 제안에 초점을 두었기 때문에 예측 모델은 랜덤 포레스트(Random Forest),
XGBoost(eXtreme Gradient Boosting) 등 전통적 기계학습 모델 중심으로 구성하였다. 이는 제한된 데이터 환경에서의 안정성과
변수 중요도 해석 가능성을 고려한 선택이었으나, 복합적 비선형 관계 및 시간적 손상 진행 특성을 충분히 반영하는 데에는 한계가 존재할 수 있다. 또한
RAG 프레임워크의 적용 가능성 검증에 초점을 둠에 따라 사용된 대규모 언어모델 및 임베딩 모델 종류에 따른 성능 차이를 비교하지 않았다.
2. 데이터
2.1 데이터 수집
교량의 안전등급 예측을 위한 분류모델에 사용되는 데이터는 국토교통부의 전국 교량 표준 데이터(MOLIT, 2025a)와 전국 교량 및 터널 현황정보(MOLIT, 2025c)을 기반으로 구축하였다. 앞서 언급한 교량 분석 대상은 전국 35,902개 교량 중 과거 관리 이력이 기록되어 있는 일반국도 약 8,890개 교량으로
한정하였다. 의사결정 지원을 위한 RAG 구축에서는 국토교통부의 전국 교량 표준 데이터(MOLIT, 2025a)와 추가적으로 시설물 보수·보강 이력(MOLIT, 2025b) 데이터를 사용하였다.
2.1.1 예측모델 변수 선정 특성 정제
교량 열화 예측모델 학습을 위해 데이터 클리닝을 수행하였다. 본 연구의 목적은 상대적으로 관리 우선순위에서 간과될 수 있는 A·B등급 내 잠재적 C등급
교량을 조기에 선별하는 데 있으며, 전체 데이터 중 D등급(0.39 %) 및 E등급(0.056 %) 교량은 표본 수가 극히 적어 학습 과정에서 노이즈를
유발하므로 제외하였다. 또한 결측 치가 과도하게 존재하거나 모든 교량에서 동일한 값으로 기록된 변수는 변별력이 없으므로 분석 대상에서 제거하였다.
도로종류는 일반도로만을 대상으로 하였으며, 이는 이후 의사결정 지원 모델에서 사용되는 점검 이력 데이터의 범위와 일관성을 유지하기 위함이다. 교량의
행정적 식별 정보(노선명, 주소, 행정구역 코드 등)는 안전등급 예측에 직접적인 영향을 주지 않으므로 제외하였다. 상부구조형식은 기존문헌에서 교량의
사용재료에 따라 구분한 방식을 바탕으로 PSC교, RC교, 강교, 기타의 네 가지 범주로 재 분류하였다(Hur et al., 2010;
Hong and Jeon, 2023). 관리 이력 변수로는 준공연도와 최종안전점검일자의 차이를 이용해 공용기간을 산정하였으며, 정기점검 주기를 고려하여 ‘2년 이내 점검 여부’ 변수를
추가하였다. 본 연구에서 범용적으로 확보 가능한 점검 기록 원본 데이터에 기반하기 위하여 하천환경 여부는 염해 및 수리학적 영향 가능성을 간접적으로
반영하는 대리 변수로, 공용기간은 재료 열화 및 탄산화 누적 정도를 간접적으로 반영하는 변수로 활용하였다. 하천환경 여부 변수는 교량 위치와 하천
공간 데이터를 중첩함으로써 도출하였다. 설계활하중은 범주형 변수로 처리하여 원-핫 인코딩을 적용하였다. 또한 2024년 교통량 데이터를 결합하여 교통량
변수를 추가하였다.
2.1.2 예측모델 변수간 상관성 분석
분류모델 학습 시 변수 간 중복적 영향으로 인한 오버 피팅을 방지하기 위해 상관관계 분석을 수행하였다. 연속형 변수 간 선형 관계를 평가하기 위해
피어슨 상관계수를 활용하였다. 분석 결과, 상하행선분리여부, 차로 수, 교량폭은 높은 상관성을 보여 동일한 구조적 특성을 중복 반영하는 것으로 판단되었다.
이에 따라 대표성을 고려하여 교량폭 만을 최종 변수로 채택하였다. Hong and Jeon(2023)을 포함한 선행 연구에서 교량 상태를 설명하는 핵심 변수로 제시된 교량연장, 교량폭, 공용기간은 상관계수와 관계없이 유지하였다. 최종적으로 시설물종별등급구분,
교량연장, 교량폭, 교량보도폭, 교량높이, 상부구조형식, 2년 이내 점검 여부, 공용기간, 설계활하중, 하천환경 여부, 교통량을 예측 변수로 선정하였다.
선행연구에서는 경간 길이, 하부구조 형식, 최대 경간장 등 구조적 세부 변수를 활용한 사례가 있으나(Lim et al., 2016), 본 연구는 전국 단위에서 범용적으로 확보 가능한 점검 기록 공개 데이터를 기반으로 변수를 구성하였으므로 사용 변수 구성에 차이가 있다. Table 1에 선행연구에서 사용된 변수와 본 연구에서 선정된 변수들을 비교 정리하였다.
Table 1. Comparison of the Variables of the Classification Model of the Preceding Study and This Study
|
Reference
|
Variables used
|
|
Hong and Jeon, 2023
|
Service period, bridge length, bridge width, superstructure type, average daily traffic
(ADT), repair/reinforcement history, carbonation and chloride attack by bridge location,
etc.
|
|
Chung et al., 2016
|
Road type, city/province, total width, height, number of spans, maximum span length,
superstructure, substructure, design load, traffic volume, year of completion, etc.
|
|
Lim et al., 2016
|
General information (bridge grade, location, managing authority, traffic volume, bridge
length, number of lanes, etc.), Structural information (span length, deck, girder,
pier, etc.), Inspection records (member code, damage code, maintenance history, etc.)
|
|
Nguyen and Dinh, 2019
|
Current bridge age, average daily traffic (ADT), design live load, structural type,
approach span type, number of main spans, etc.
|
|
This study
|
Facility class grade, bridge length, bridge width, bridge sidewalk width, bridge height,
superstructure type, inspection within 2 years (Y/N), service period, design live
load, river environment (Y/N), traffic volume
|
3. 분석 대상 교량 데이터의 표본 추출 및 정규화
3.1 예측모델 데이터
3.1.1 이상치 제거
점검 데이터에 포함될 수 있는 비정상적 값과 기록 오류의 영향을 완화하기 위해 이상치 탐지 알고리즘(Isolation Forest) 기반의 이상치
제거를 수행하였다(Emmott et al., 2013;
Kim and Scott, 2008). 안전등급별 분포 차이를 고려하여 A, B, C 등급을 각각 분리한 뒤, 수치형 변수에 대해 표준화를 적용하고 등급별로 이상치를 탐지하였다. 이상치
탐지 결과, 각 등급에서 약 5 % 내외의 샘플이 제거되었으며, 이후 C등급을 기준으로 A 및 B등급 데이터를 균형 샘플링하여 학습 데이터를 구성하였다.
이를 통해 특정 이상치에 대한 모델의 과도한 의존을 방지하고, 보다 안정적인 예측 성능을 확보하였다.
3.1.2 기계학습 배치 샘플링 전략
A, B, C 등급 교량 데이터는 등급별 표본 수의 불균형이 매우 크며, 특히 C 등급 데이터가 부족한 특성을 가진다. 이러한 데이터 불균형 문제는
분류모델의 학습 과정과 예측 성능에 직접적인 영향을 미치는 요인으로 알려져 있으며, 샘플링 방식의 선택에 따라 모델 성능에 영향을 주는 것이 다수의
선행연구에서 보고된 바 있다(Dubey et al., 2014;
Zong et al., 2013;
Bach et al., 2019;
Hashemi and Karimi, 2018;
Altalhan et al., 2025). 이에 본 연구에서는 교량 안전등급 분류 문제에 대해 대표적인 세 가지 샘플링 전략들(랜덤 언더샘플링, 반복 배치 기반 언더샘플링, 밸런스 가중치
방식)을 적용하여 분류모델의 성능을 비교·분석하였다. 그 결과, 데이터 손실을 최소화하면서도 소수 등급(C 등급)에 대한 예측 성능을 안정적으로 확보할
수 있었던 밸런스 가중치 방식을 본 연구의 배치 샘플링 전략으로 채택하였다.
3.2 의사결정지원모델
3.2.1 데이터 및 교량 단위 문서 구성
RAG 시스템 구축을 위해 국토교통부 전국 교량 표준 데이터와 시설물 보수·보강 이력 데이터를 활용하였다. 전자는 교량의 고정적 특성을 교량당 1행으로
기록한 데이터이며, 후자는 동일 교량에 대한 점검·보수·보강 이력이 시간 순으로 누적된 구조를 가진다. 이러한 원본 데이터 구조는 통계 분석에는 적합하지만,
RAG 기반 질의응답에서는 동일 교량의 정보가 분산되어 검색 맥락이 단절될 가능성이 있다(Omar and Moselhi, 2026). 이에 본 연구에서는 두 데이터를 통합하여, 하나의 교량을 하나의 문서 단위로 구성하는 교량 단위 JSONL 구조로 재구성하였다. 데이터 통합 과정에서는
교량명과 노선명을 결합한 공용 식별 정보(이하 common_ID 라고 함)를 생성하였으며, 각 JSONL 문서는 교량의 기본 특성 정보와 점검·보수·보강
이력을 시간 순으로 포함하도록 설계하였다. 이를 통해 교량 단위 질의에 일관되게 대응하고, 점검 이력의 시간적 흐름을 유지할 수 있도록 하였다. 자세한
사항은 부록 Table A4에서 확인할 수 있다.
3.2.2 임베딩 및 검색 전략
교량 하나에 대해 다수의 점검 이력이 존재함에 따라, 단일 문서 임베딩 시 토큰 한계 및 검색 성능 저하 문제가 발생할 수 있다. 이에 본 연구에서는
교량 단위 문서를 여러 개의 텍스트 청크로 분할하여 임베딩하는 청킹 전략을 적용하였다. 각 교량에 대해 기본 특성 정보를 포함한 베이스 청크와, 점검·보수·보강
이력을 시간 순으로 분할한 이력 청크를 구성하였으며, 모든 청크에는 common_ID를 포함시켜 검색 이후에도 교량 단위 맥락이 유지되도록 하였다.
검색 단계에서는 질의와의 유사도를 기준으로 상위 청크들을 선별한 뒤, 동일 교량에 해당하는 청크들을 통합하여 교량 단위 컨텍스트를 구성하였다. 구체적인
사항에 대하여 부록 A을 참고할 수 있다.
4. 교량 안전등급 예측을 위한 AI 분류모델과 의사결정 모델 방법론
본 연구에서는 교량 유지관리 의사결정을 지원하기 위해, 안전등급 예측을 수행하는 분류모델과 점검 이력 기반 질의응답을 제공하는 RAG 시스템을 결합한
통합적 의사결정지원 모델을 구성하였다.
Fig. 2. RAG Pipeline for Bridge Maintenance History Retrieval and Context-Aware Answer Generation
먼저 분류모델 단계인 안전등급 예측에 사용된 알고리즘은 의사결정나무, 랜덤 포레스트, 그리고 XGBoost이다(Quinlan, 1986;
Tin Kam Ho, 1995;
Chen and Guestrin, 2016). 구체적인 하이퍼파라미터는 부록 Table A1, Table A2, Table A3에서 확인할 수 있다.
Table 2. Comparison of AI Classification Algorithms
|
Category
|
Decision Tree
|
Random Forest
|
XGBoost
|
|
Model structure
|
Single tree-based classification and regression model
|
Ensemble model combining multiple trees
|
Boosting model that sequentially combines multiple trees
|
|
Learning principle
|
Splits data by impurity reduction to build a single tree
|
Builds multiple decision trees, then aggregates by majority vote/averaging
|
Trains each subsequent tree to correct the errors of the previous one
|
|
Training method
|
Trains a single tree at once
|
Trains trees independently in parallel
|
Trains trees sequentially (error-driven)
|
|
Overfitting
|
Vulnerable as the tree grows deeper
|
Substantially mitigated vs. a single decision tree
|
Prevents overfitting via regularization terms
|
분류 성능이 우수하다고 판단된 모델을 기반으로 2036년 시점의 교량 안전등급을 시나리오 기반 참고 정보로 산출한다. 본 연구의 장기 예측은 미래
상태를 확정적으로 예측하는 것을 의미하지 않으며, 현재의 구조적·환경적 조건이 유지된다는 가정 하에서 공용기간 변수를 +10년 조정하여 입력한 결과에
해당한다. 따라서 이는 유지관리 우선순위 설정을 위한 위험 신호로 활용될 수 있는 참고 수준의 예측으로 해석되어야 한다.
이후 사용자가 특정 교량에 대해 질의를 입력할 경우, 시스템은 예측된 미래 안전등급을 제시하고, 해당 교량과 관련된 과거 점검·보수·보강 이력을 RAG
기반 질의응답을 통해 설명하는 방식으로 응답을 구성한다. 이를 통해 단일 예측 결과를 제시하는 데 그치지 않고, 예측 결과가 어떤 관리 이력과 맥락에서
도출되었는지를 함께 제공하는 것을 목표로 한다.
Uhm et al.(2025)에 따르면 건설분야 RAG 기반의 GPT 모델 활용은 정확한 규제 정보와 실용적인 안내를 제공하는 데에 유용하게 사용될 수 있다. 이에 따라 교량
점검 이력 기반 RAG 시스템을 구현하기 위해 Python 환경에서 OpenAI API를 활용하였다.
임베딩 모델로는 text-embedding-3-small을 사용하였다. 해당 모델은 비교적 낮은 차원의 임베딩 벡터를 제공하면서도 의미적 유사도 검색
성능이 안정적이며, 교량 단위 문서 검색에서 유사 교량 후보를 효율적으로 선별하는 데 적합하다고 판단하였다. 텍스트 생성 모델로는 gpt-4o-mini를
사용하였다. 본 연구의 RAG 시스템은 창의적 문장 생성보다는 점검 이력 및 보수·보강 정보를 사실 중심으로 요약·설명하는 기능이 핵심이므로, 응답
안정성과 비용 효율성을 고려하여 해당 모델을 채택하였다.
검색기는 벡터DB 내 질의 유사도 평가를 위해 벡터 기반 유사도 검색과 교량명 기반 직접 검색을 병행하도록 설계되었다. 질문에 교량명이 명시된 경우에는
해당 교량의 전체 이력을 직접 조회하고, 그렇지 않은 경우에는 임베딩 기반 검색(Top-k)을 통해 관련 교량 이력을 선별하였다.
생성 단계에서는 질문의 구체성에 따라 검색 및 응답 흐름이 세 가지 경로로 분기했다. 질문에 특정 교량명이 명확히 포함된 경우(경로 A)에는 해당
교량의 컨텍스트와 구성하여 단일 교량 중심의 해석적 응답을 생성한다. 교량명이 포함되어 있으나 오타 가능성이 존재하는 경우(경로 B)에는 유사한 교량명을
사용자에게 제시하여 재확인을 요청함으로써, 잘못된 교량을 대상으로 한 응답 생성을 사전에 차단한다. 반면, 질문에 특정 교량명이 포함되지 않은 경우(경로
C) 전반적 경향을 설명하는 응답을 생성한다. 분기 사항에 대하여 부록 A.3에서 설명된다. 이러한 분기형 RAG 구조를 통해 본 시스템은 단일 교량의
미래 상태 예측과 과거 관리 이력에 대한 해석, 그리고 일반적인/비교 질의에 대한 대응을 하나의 흐름으로 통합함으로써, 교량 유지관리 의사결정에 필요한
정량적 정보와 맥락적 정보를 동시에 제공하는 구조를 갖는다.
Fig. 3. User Query Handling and Hybrid Retrieval Logic in the Bridge Maintenance RAG System
5. 분류모델 성능평가
5.1 분류모델 학습 성능 평가지표
모델 평가에는 정확도(accuracy), 정밀도(precision), 재현율(recall), F1 score를 사용하였다. 정확도(accuracy)는
전체 예측 결과 중 실제값과 일치한 예측의 비율을 의미한다. 정밀도(precision)는 모델이 정답으로 예측한 사례 중 실제 정답인 비율이며, 재현율(recall)은
실제 정답 사례 중 모델이 올바르게 예측한 비율을 의미한다. F1-score는 정밀도와 재현율의 조화평균으로 산출되며, 두 지표 간의 균형적인 분류
성능을 평가하는 데 활용된다.
본 모델에서 사용한 교량 안전등급 데이터는 특정 등급에 데이터가 집중된 특성을 가진다. 이는 다수 클래스의 예측 성능에 의해 과대평가될 수 있으며,
소수 클래스에 대한 예측 성능을 적절히 반영하지 못하는 한계가 있다. 이에 각 클래스별 재현율을 동일하게 고려하는 균형 정확도(balanced accuracy)를
주요 성능 지표로 사용하였다. 균형 정확도는 혼동 행렬을 기반으로 각 클래스별 재현율의 평균으로 정의되며, 불균형한 데이터 분포로 인해 전체 정확도가
과대평가되는 문제를 효과적으로 완화할 수 있다(Brodersen et al., 2010).
5.2 분류모델 학습 성능
의사결정 나무 모델의 정확도는 53.5 %, 균형 정확도는 55.3 %으로 나타났으며, 이는 랜덤 포레스트 및 XGBoost 모델에 비해 비교적 낮고
불안정한 예측 성능이었다. 그러나 세부 성능을 살펴보면, C등급 교량에 대한 재현율 값은 0.50으로 나타나 XGBoost 모델의 0.26보다 높은
수준을 보였다. 이는 의사결정 나무 모델이 상대적으로 C등급 교량을 탐지하는 민감도 측면에서는 더 나은 성능을 보인다는 것을 의미한다. 다만 C등급의
정밀도는 0.15로 낮게 나타났으며, Table 5의 혼동행렬을 살펴보면 실제 C등급 교량을 A등급으로 오분류하는 사례가 다수 발생한 것을 확인할 수 있다. 이는 모델이 일부 C등급 교량의 특성을
충분히 학습하지 못한 상태에서 상위 등급으로 과대평가하는 경향이 있음을 시사하며, 의사결정 나무 모델 단독으로는 안정적인 등급 분류에 한계가 있음을
보여준다.
Table 3. Overall Performance Evaluation Summary for each AI Classification Model
|
|
Decision Tree
|
Random Forest
|
XGBoost
|
|
Samples
|
2,533
|
1,689
|
1,689
|
|
Accuracy
|
0.535
|
0.683
|
0.741
|
|
Balanced Accuracy
|
0.553
|
0.715
|
0.732
|
|
F1-macro
|
0.465
|
0.639
|
0.600
|
Table 4. Performance Metrics for Each AI Classification Model
|
Model
|
Grade
|
Precision
|
Recall
|
F1-score
|
Support
|
|
Decision Tree
|
A
|
0.54
|
0.75
|
0.63
|
899
|
|
B
|
0.77
|
0.41
|
0.53
|
1485
|
|
C
|
0.15
|
0.50
|
0.23
|
149
|
|
Macro Avg.
|
0.49
|
0.55
|
0.47
|
2533
|
|
Random Forest
|
A
|
0.59
|
0.87
|
0.71
|
600
|
|
B
|
0.88
|
0.57
|
0.69
|
990
|
|
C
|
0.41
|
0.71
|
0.52
|
99
|
|
Macro Avg.
|
0.63
|
0.72
|
0.64
|
1,689
|
|
XGBoost
|
A
|
0.73
|
0.76
|
0.74
|
600
|
|
B
|
0.79
|
0.78
|
0.79
|
990
|
|
C
|
0.28
|
0.26
|
0.27
|
99
|
|
Macro Avg.
|
0.60
|
0.60
|
0.60
|
1,689
|
Table 5. Prediction Accuracy for Each AI Classification Model
|
Model
|
|
Predicted A
|
Predicted B
|
Predicted C
|
|
Decision Tree
|
Actual A
|
671
|
141
|
87
|
|
Actual B
|
547
|
609
|
329
|
|
Actual C
|
29
|
45
|
75
|
|
Random Forest
|
Actual A
|
523
|
65
|
12
|
|
Actual B
|
342
|
561
|
87
|
|
Actual C
|
16
|
13
|
70
|
|
XGBoost
|
Actual A
|
448
|
140
|
12
|
|
Actual B
|
155
|
778
|
57
|
|
Actual C
|
15
|
60
|
24
|
랜덤 포레스트 모델의 전체 정확도는 68.3 %로 나타나 의사결정 나무 모델 대비 향상된 예측 성능을 보였다. 특히 C등급에 대한 정밀도는 0.41로
세 모델 중 가장 높은 값을 나타냈으며, 재현율 또한 0.71로 가장 높은 수준을 보였다. 이는 랜덤 포레스트 모델이 C등급 교량을 탐지하는 능력과
동시에 오분류를 억제하는 측면에서도 상대적으로 우수한 성능을 보였음을 의미한다. 또한 macro 평균 기준으로 정밀도는 0.63, 재현율은 0.72로
나타나 세 모델 중 전반적으로 가장 균형 잡힌 성능을 보였다. 다만 A등급과 B등급의 F1-score를 비교하면, 해당 등급에서는 XGBoost 모델이
랜덤 포레스트 모델보다 다소 높은 성능을 보이는 것으로 나타났다.
XGBoost 모델은 정확도 74.1 %, 균형 정확도 73.2 %로 나타나 세 모델 중 가장 높은 전체 분류 성능을 보였다. 또한 F1-score
기준에서도 A등급과 B등급에서 각각 0.74, 0.79로 가장 높은 성능을 나타내어 상위 등급 교량 분류에서 우수한 예측 능력을 보였다. 그러나 C등급에
대해서는 상대적으로 낮은 성능을 보였으며, 정밀도 0.28, 재현율 0.26으로 랜덤 포레스트 및 의사결정 나무 모델에 비해 탐지 성능이 저하되는
특징이 나타났다. 혼동행렬을 살펴보면 실제 C등급 교량을 B등급으로 예측하는 사례가 다수 발생한 것으로 확인된다. 이는 XGBoost 모델이 전체적인
분류 정확도는 높지만, 상대적으로 데이터 비율이 낮거나 특성이 불명확한 C등급 교량을 상위 등급으로 과소평가하는 경향이 있음을 시사한다.
5.3 안전등급 예측모델 토의
위와 같은 과정을 통해 의사결정 나무, 랜덤 포레스트, XGBoost 모델을 구축하고 성능을 비교하였다. 평가 결과, 테스트 표본 균형 정확도는 XGBoost(0.732)가
가장 높았으며, 그 다음이 랜덤 포레스트(0.715), 의사결정 나무(0.553) 순으로 확인되었다. 이는 기존 연구인 Hong and Jeon(2023)에서 보고된 랜덤 포레스트의 랜덤 언더샘플링 결과(67.0 %) 및 랜덤 오버 샘플링 결과(64.7 %)보다 소폭 향상된 성능으로, 본 연구에서 이상치
탐지 알고리즘를 활용하여 데이터의 이상치를 제거하여 얻어진 성능 향상으로 판단된다. C등급 F1-score는 재현율과 정밀도를 종합적으로 반영한 참고
지표로서 XGBoost가 가장 높은 값을 보였으나, 본 연구의 목적은 정확한 C등급(점검 필요 교량) 예측을 통해 유지관리 인력의 우선 배분을 지원하는
것이므로, C등급의 재현율과 정밀도를 더 중점적으로 평가했다. 재현율(C)은 C등급 교량을 누락 없이 식별하는 성능을 나타낸 것이며, 정밀도(C)은
C등급으로 예측된 교량 중 실제 C등급에 해당하는 비율을 의미한다. 즉, 사고 위험이 있는 낮은 등급 교량을 놓치지 않는 것이 중요하므로 재현율이
더 중요한 지표가 되며(의사결정 나무: 0.50/랜덤 포레스트: 0.71/XGBoost: 0.26), 랜덤 포레스트가 가장 높은 성능을 보였다. XGBoost는
순차적 부스팅 구조를 기반으로 전체 손실 최소화에 최적화되므로, 표본 비율이 높은 A·B등급의 예측 성능 개선에 집중하는 과정에서 소수 클래스인 C등급을
상위 등급으로 오분류하는 경향을 보였다. 반면, 랜덤 포레스트는 독립적 결정트리 기반의 다수결 구조와 클래스 빈도에 반비례하는 가중치 부여를 통해
클래스 불균형 영향을 일부 완화한 것으로 판단된다. 혼동행렬 분석 결과, 랜덤 포레스트는 위험 교량인 C등급 교량을 A, B등급이라고 판단한 누락(false
negative)이 29건, A, B등급의 교량을 C등급이라고 예측한 불필요 점검(false positive)이 99건 발생한 반면, XGBoost는
각각 75건과 69건으로 나타났다. 안전과 직결된 교량의 점검 관점에서 예측모델은 보수적으로 예측할 필요가 있다. 이 관점에서 XGBoost는 랜덤
포레스트 대비 누락 비율이 약 2.6배 높아, 위험 교량을 과소 예측하는 경향이 있음을 확인할 수 있다.
또한 선행연구에서는 예방적 유지관리가 교량의 생애주기비용을 연간 92억 절감하며, 교량 상태 악화에 따라 유지관리 비용 부담이 증가하는 것으로 보고된
바 있다(Jeong et al., 2016). 실제 교량 유지관리 환경에서는 위험 교량 누락(false negative)에 따른 비용이 불필요한 점검(false positive) 비용보다 상대적으로
크게 작용할 가능성이 높으므로, 랜덤 포레스트 모델의 선정은 실무적으로 타당한 선택으로 판단된다.
6. 통합적 의사결정지원 모델 평가
6.1 학습 결과
앞서 상대적으로 가장 적절한 모델로 선정된 랜덤 포레스트 모델을 활용하여 교량의 등급을 예측하고, 점검 이력 및 구조 정보를 기반으로 한 RAG시스템을
결합하여 하나의 통합 의사결정지원 시퀀스를 구성하였다. 본 시스템은 다음의 세 단계를 통해 작동한다. 현재 교량 데이터를 기반으로 랜덤 포레스트 모델을
활용한 등급 예측 수행, 과거 점검 이력 및 구조 정보 검색, 질의 유형에 따라 분기된 응답을 생성한다. 이 과정에서 예측 결과는 단일 등급만을 제시하는
것이 아니라, 랜덤 포레스트의 개별 트리 예측 분포를 기반으로 각 안전등급에 대한 예측 확률(confidence)을 함께 제공하였다. 예를 들어,
Table 6의 “C(40 %)”와 같은 표현은 특정 등급으로 예측된 확정값이 아니라, 전체 트리 중 해당 등급으로 분류한 비율을 의미하며, 이는 예측의 불확실성을
함께 고려할 수 있도록 한다. 따라서 담당자는 미래 위험 수준을 단일 결과가 아닌 확률적 참고 정보로 해석할 수 있다. 의사결정 모델은 입력 쿼리
유형에 따라 3가지 경로로 응답이 분기되도록 설계되었으며, 특정 교량에 대한 상세 질의, 일반적 구조 정보 질의, 예측 등급 관련 질의에 대해 각각
다른 응답 전략을 적용하였다. Table 6에 경로 A의 예시와 Table 7에 경로 B의 예시를 나타내었다.
6.2 의사결정 지원모델 성능 평가지표
RAG 모델의 성능 평가는 무작위로 선정된 50개 교량을 대상으로 총 110개의 질의를 구성하여 수행하였다. 질의는 총 5가지 유형(single_
specification, single_inspection, temporal_range, comparison, aggregation)으로 구성하였다.
single_specification은 교량의 상부구조 형식, 설계활하중, 준공연도 등 단일 사실 검색 성능을 평가하기 위한 질의이며, single_inspection은
특정 시점 점검 결과와 손상 정보를 질의하여 단일 교량의 상세 정보 검색 성능을 검증한다. temporal_range는 일정 기간 내 안전등급 변화와
같은 시계열 정보를 대상으로 시간 범위 조건 검색 능력을 평가하며, 세 질문은 3가지 분기 중 A 경로의 베이스 컨텍스트에 대한 검증이 가능하다.
comparison은 두 교량 간 준공연도, 등급 등의 상대 비교를 통해 비교 기반 추론 능력을 검증한다. 마지막으로 aggregation은 점검
횟수 또는 등급 분포와 같이 다중 행 정보를 종합하는 집계 기반 질의를 포함하여 복합 추론 성능을 평가하였다. 두 질문은 여러 교량명이 질의로, C
경로에 대한 질문의 검증이다. 평가 지표로는 RAG 과정을 자동화된 방식으로 평가할 수 있도록 하는 라이브러리인 RAGAS(Retrieval-Augmented
Generation Evaluation System)를 이용하여, 검색 및 생성 성능을 종합적으로 평가할 수 있는 문맥 정밀도(context precision),
문맥 재현율(context recall), 충실도(faithfulness), 답변 관련성(answer relevancy)를 사용하였다. 문맥 정밀도는
검색된 문맥 중 실제 답변에 기여한 정보의 비율을 나타내며, 문맥 재현율은 정답 도출에 필요한 정보가 검색 단계에서 얼마나 포함되었는지를 평가한다.
충실도는 생성된 답변이 검색된 문맥에 기반하여 일관되게 작성되었는지를 측정하는 지표로, 환각 여부를 검증한다(Es et al., 2025). 또한 답변 관련성는 생성된 답변과 주어진 질문 사이의 관련성을 측정하는 지표이다.
6.3 성능 평가결과
선행 연구에서는 900개 이상의 방대한 질문 쿼리와 답변 세트를 구성하고, WikiQA Dataset을 사용하여 광범위한 성능 검증을 수행하였다.
반면 본 연구는 실무적인 프레임워크 제안에 초점을 맞추어 110개의 질문 쿼리와 50개 교량이라는 상대적으로 소규모의 데이터셋을 대상으로 평가를 진행하였다.
Yang et al.(2026)에 따르면 GPT-4, Gemini 1.5 pro 등에서 충실도 92 %에서 80 %, 문맥 정밀도 88 %에서 77 %, 답변 관련성 89 %에서
78 %의 수치를 보인다. 본 연구의 RAG 평가 결과, 각각 93.4 %, 44.5 %, 50.5 %, 60.9 %로 도출되었다. 본 연구의 RAG
모델의 성능을 평가해보았을 때, 충실도는 기존의 범용 LLM 모델과 유사한 성능을 기록했음을 알 수 있다. 질의 유형별 성능 분석 결과, 단일 정보
검색(single specification, single inspection) 유형에서는 전반적으로 높은 수준의 응답 정확성과 문맥 기반 일관성을
나타냈다. 이는 교량 제원, 특정 시점 점검 결과 등 비교적 명확한 단일 사실(single fact)을 대상으로 하는 질의에서, 검색된 문맥이 응답
생성에 직접적으로 활용되었기 때문으로 판단된다. 특히 단일 교량의 특정 시점 정보나 제원 정보는 데이터 구조상 독립적인 레코드 형태로 저장되어 있어
검색 및 응답 생성 과정에서 높은 안정성을 보였다.
Table 6. RAG Interaction When Path A
|
대한민국 일반국도 교량 데이터 기반 질의응답 시스템입니다. 질문을 남겨주세요.
|
|
질문
|
신용교에 2020년부터2023년 점검이력을 설명해주고 추가적인 보수가 필요한 부분이 있는지 알려줘
|
|
debug
|
[DEBUG1] 질문 분석 시작 [DEBUG2] 교량 직접 일치여부 : 신용교, 유사 일치 제안 : NONE [DEBUG3] 경로A : 교량명 ‘신용교’ 직접일치. 원본 레코드 검색시작.
|
|
|
신용교에 대한 최근 진행된 안전점검 등급은 B이며, 예측모델을 사용하여 평가한 등급은 C(40 %)입니다. 10년 뒤 예측되는 등급은 C(49 %)입니다. 2020년 1월 1일부터 2023년 10월 1일까지의 점검 이력을 살펴보면, 2020년 12월 31일에 실시된 점검에서 점검진단결과등급이 B로 유지되었습니다.
이 시기에는 특별한 손상이나 조치가 발견되지 않았습니다. 그러나 2021년 12월 31일 점검에서는 교량의 상태가 악화되어 점검진단결과등급이 C로
하락하였습니다. 이때 발견된 손상은 수직보강재의 이격 현상이었으며, 이에 대한 조치로는 ‘예산 확보 후 보수 시행’이 필요하다는 권고가 있었습니다. 2022년 12월 31일 점검에서는 등급이 다시 B로 회복되었으나, 여전히 수직보강재 이격 현상이 지속되고 있었습니다. 마지막으로 2023년 10월 1일 점검에서도 B 등급이 유지되었지만, 여전히 보수가 필요한 상태입니다. 따라서 신용교는 현재 B 등급을 유지하고 있으나, 수직보강재 이격 현상으로 인해 추가적인 보수가 필요한 상황입니다.
|
Table 7. RAG Interaction When Path B
|
대한민국 일반국도 교량 데이터 기반 질의응답 시스템입니다. 질문을 남겨주세요.
|
|
질문
|
신응교에 대해 설명해줘
|
|
debug
|
[DEBUG] 질문 분석 시작: 신응교에 대해 설명해줘 [DEBUG] 교량명 직접 일치 여부: None, 유사 일치 제안: 신용교 [DEBUG] 경로 B: 교량명 오타 의심! 사용자에게 다시 질문하고 종료.
|
|
|
질문하신 내용에 오타가 의심됩니다. 혹시 **'신용교'** 교량에 대한 답변을 원하시는 경우, 이 교량은 **'일반국도13호선'**에 위치하며 **1990년**에
준공되었습니다. 교량명을 정확히 수정하여 다시 질문해 주시겠어요? 2022년 12월 31일 점검에서는 등급이 B로 회복되었으나, 여전히 수직보강재 이격 현상이 지속되고 있었습니다. 2023년 10월 1일 점검에서도
B 등급이 유지되었지만, 여전히 보수가 필요한 상태입니다. 따라서 신용교는 현재 B 등급을 유지하고 있으나, 수직보강재 이격 현상으로 인해 추가적인 보수가 필요한 상황입니다.
|
반면, 비교 질의(comparison), 시간 범위 질의(temporal range), 집계 기반 질의(aggregation)에서는 상대적으로 낮은
검색 성능 지표가 관찰되었다. 이러한 질의 유형은 다수의 시점 정보 또는 복수 레코드 간 관계 추론을 요구하므로, 단일 사실 검색보다 높은 수준의
문맥 통합 능력이 요구된다. 그러나 본 연구의 RAG 파이프라인은 하나의 질의에 대해 A경로는 기본 정보(base chunk)와 이력 정보(history
chunk)를 각각 1개로 제한적으로 검색하는 구조를 채택하고 있으며 10년 이상의 점검 시점 차이 복수 교량 정보를 동시에 참조해야 하는 질의에서
문맥 재현율 및 문맥 정밀도의 저하로 이어진 것으로 해석된다. 또한 다수 교량 비교질의에서 A경로로 분기되는 오류가 존재함을 확인하였다. 향후에는
질의 유형에 따라 동적으로 검색 범위를 조정하거나, 질의 분해(query decomposition) 기법을 적용함으로써 복합 질의에 대한 응답 성능을
개선할 필요가 있다.
Table 8. Performance Evaluation Results of RAG by RAGAS
|
Faithfulness
|
0.934
|
|
Context Precision
|
0.445
|
|
Context Recall
|
0.505
|
|
Answer Relevancy
|
0.609
|
7. 결론 및 토의
본 연구의 핵심적인 기여는 교량 유지관리 문제를 ‘정확한 등급 분류’의 차원을 넘어, ‘제한된 자원 하에서의 합리적 우선순위 설정’의 문제로 재정의하고
이에 적합한 이중 단계 프레임워크를 제안했다는 점에 있다. 본 프레임워크 내에서 랜덤 포레스트 기반 분류 모델은 대규모 교량 자산을 대상으로 위험
교량을 신속하게 선별하는 정량적 기능을 담당하며, RAG 시스템은 개별 교량의 과거 점검·보수 이력 및 유사 사례를 바탕으로 예측 결과를 맥락적으로
설명하여 관리자의 판단을 보조한다. 이는 예측과 해석, 그리고 의사결정 지원을 하나의 흐름으로 연결함으로써 기존 BMS가 가진 ‘예측 모듈 단독 활용’의
한계를 보완하려는 시도로서 중요한 의의를 지닌다.
모델 선정 과정에서 XGBoost가 균형 정확도 측면에서 가장 높은 수치를 기록하였으나, 본 연구는 유지관리 우선순위 설정 관점에서 C등급 교량의
누락을 최소화하는 것이 더 중요하다고 판단하였다 특히 C등급 재현율이 낮을 경우 실제 위험 교량이 관리 우선순위에서 누락되어 안전 측면의 손실이 커질
수 있음을 고려할 때, 이에 따라 C등급의 재현율이 높은 랜덤 포레스트를 최종 모델로 선택하였다. 이는 단일 종합 지표의 최적화가 아니라 현장 운영
목적에 맞춘 모델 선택이라는 점에서 타당성을 확보한다.
RAG 평가 결과, 충실도(93.4 %), 문맥 정밀도(44.5 %), 문맥 재현율(50.5 %), 답변 관련성(60.9 %) 지표를 통해 검색된
문맥의 관련성이 높고 생성된 답변이 검색 문맥에 충실히 근거하고 있음을 확인하였다. 이는 단순 LLM 질의응답 방식과 비교하여 점검 및 보수 이력에
기반한 응답이 환각 현상을 완화하고 근거 중심의 설명을 제공할 가능성을 시사한다. 다만, 정확한 정보 전달이 필요한 실무적 조건으로 볼 때 정답에
필요한 근거가 일부 누락될 수 있다는 점이 확인되었으므로, 향후 기간 조건이나 특정 부재 및 손상 조건 등 검색 누락이 발생하기 쉬운 질의 유형을
중심으로 검색 및 후처리 전략을 개선할 필요가 있다.
본 연구가 제시한 통합적 의사결정 지원 모델의 가장 큰 장점은 현재의 관측 등급과 과거의 정성적 맥락, 그리고 미래의 정량적 예측 결과를 단일 인터페이스상에서
연결하여 제시할 수 있다는 점이다. Brighenti et al.(2024) 등이 지적한 바와 같이 기존 BMS는 데이터 관리와 진단에 비해 의사결정 모듈이 상대적으로 취약했으나, 본 연구는 분류 모델과 RAG를 결합하여
의사결정 모듈을 ‘위험 교량 선별 및 근거 제시’의 형태로 구체화하였다는 점에서 실무적 시사점이 크다. 하지만 본 연구의 2036년 장기 예측은 단일
시점 기반 학습 모델에 공용기간 변수를 조정하여 적용한 방식으로, 동적인 시간 의존적 요인을 충분히 반영하지 못한다는 한계를 가진다. 따라서 본 연구의
장기 예측 결과는 미래 상태를 확정적으로 판단하기 위한 목적보다는, 현재 조건이 유지될 경우 발생 가능한 위험 수준을 조기에 식별하기 위한 시나리오
기반 참고 정보로 해석된다. 향후 연구에서는 시계열 점검 이력과 시간 의존성을 반영할 수 있는 LSTM(Long Short-Term Memory)
또는 Transformer 기반 시계열 모델을 결합하여 장기 예측의 신뢰성과 설명 가능성을 향상시킬 필요가 있다. 그럼에도 불구하고 제안된 프레임워크는
관리자는 단순히 예측 등급만을 확인하는 것이 아니라 등급 변화의 배경이 된 특정 부재의 반복적 손상이나 보수 권고 미이행 이력 등을 함께 검토함으로써
점검 및 보수 우선순위를 보다 합리적으로 설정할 수 있을 것으로 기대된다.