홍철승(Hong, Chulseung)1†iD
이수연(Lee, Suyeon)2iD
문창(Moon, Chang)3
은영기(Eun, Youngkee)4
-
정회원 · 교신저자 · 한국생산기술연구원 국가엔지니어링센터, 선임연구원
(Corresponding Author · Korea Institute of Industrial Technology · cshong@kitech.re.kr)
-
정회원 · 한국생산기술연구원 국가엔지니어링센터, 수석연구원
(Korea Institute of Industrial Technology · suyeon@kitech.re.kr)
-
(주)수성엔지니어링, 전무
(Soosung Engineering Co., Ltd · cmoon@soosungeng.com)
-
한국생산기술연구원 국가엔지니어링센터, 수석연구원
(Korea Institute of Industrial Technology · yeun@kitech.re.kr)
Copyright 2026 by the Korean Society of Civil Engineers
핵심용어
건설공사 설계기준(KDS), 검색증강생성(RAG), 대규모 언어모델(LLM), 질의응답, 근거 검증
Keywords
Korean Design Standards (KDS), Retrieval-augmented generation (RAG), Large language models (LLMs), Question answering, Evidence verification
1. 서 론
건설공사 설계기준(Korean Design Standards, 이하 KDS)은 「건설기술 진흥법」 제44조와 같은 법 시행령 제65조에 근거하여 제정·관리되는
국가 건설기준이며, 표준시방서(KCS)와 함께 건설기준 코드체계를 구성한다. KDS는 지반, 구조, 교통시설, 수자원 및 건축 등 건설 분야 전반의
설계에 적용되는 기술적 요구사항을 제시하며, 설계자와 검토자는 설계 및 인허가 과정에서 이를 반복적으로 참조한다.
설계 실무에서 기준을 참조하는 작업은 관련 조항을 찾는 것으로 끝나지 않는다. 실무자가 최종적으로 확인해야 하는 것은 주어진 조건에 적용되는 값이나
규정이기 때문이다. 예를 들어 네일 보강 비탈면의 기준 안전율은 검토 대상이 내적안정인지 외적안정인지, 하중 조건이 평상시인지 지진시인지에 따라 달라지며,
각 값은 다층 헤더를 가진 하나의 표에 함께 제시된다. 따라서 관련 조항을 찾은 이후에도 표의 행과 열에 제시된 조건을 대조하여 적용할 값을 특정해야
한다. 또한 같은 수치라도 조항의 적용 범위에 따라 의미가 달라질 수 있고, 기준이 개정되면 적용해야 할 내용도 달라질 수 있다. 이에 따라 기준을
검색한 이후에도 적용 조건과 근거를 원문과 다시 대조하는 과정이 필요하다.
국내에서는 이러한 활용성을 높이기 위해 국가건설기준센터를 중심으로 건설기준 코드체계의 정비와 정보화가 추진되어 왔다(Lee and Choi, 2022;
Han et al., 2023,
2024). 최근에는 건설기준의 코드 목록과 본문 정보를 응용프로그램 인터페이스(Application Programming Interface, API)로 조회할
수 있도록 제공하고 있으며, 기준 정보를 기계가 처리하고 인공지능이 활용할 수 있는 형태로 전환하기 위한 디지털화도 추진되고 있다(MOLIT, 2025). 이러한 체계는 기준 문서의 공식 제공, 구조화, 검색 및 제·개정 정보 관리를 담당한다. 본 연구는 이러한 제공·관리 체계를 대체하거나 성능을
비교하려는 것이 아니라, 공식 기준 정보를 자연어 질의응답에 활용하고 생성된 답변을 근거와 대조하는 별도의 활용 절차를 다룬다.
자연어 기반 질의응답에는 대형 언어모델(Large Language Model, LLM)을 활용할 수 있다. 그러나 모델의 내부 지식만으로 특정 설계기준의
조항과 수치를 답변할 경우 부정확한 값을 생성하거나 그 근거를 제시하지 못할 수 있으며, 이러한 현상은 일반적으로 환각(hallucination)으로
지칭된다. 검색증강생성(Retrieval-Augmented Generation, RAG)은 외부 문서에서 관련 내용을 검색하여 생성 모델에 근거로
제공함으로써 이러한 한계를 완화하는 접근이다(Lewis et al., 2020).
그러나 RAG를 KDS 질의응답에 적용하기 위해서는 두 가지 사항을 추가로 고려해야 한다. 첫째, KDS 문서에는 조항의 계층 관계, 표의 행·열
조건과 병합 셀, 첨자를 포함한 수식 등 적용 내용을 해석하는 데 필요한 구조 정보가 포함되어 있다. 따라서 검색과 인용에 필요한 조항 경로, 표의
행·셀 순서 및 수식 표기가 검색 단위에 포함되도록 문서를 처리할 필요가 있다(Yim, 2020;
Kim, 2025). 둘째, 답변에 출처나 인용문이 제시되더라도 해당 인용문이 답변값을 실제로 뒷받침한다고 단정할 수 없다. 법률 문서를 대상으로 한 질의응답 연구에서도
인용이 제시되었으나 해당 인용이 답변을 뒷받침하지 않는 사례가 보고되었다(Magesh et al., 2025). 따라서 설계기준 질의응답에서는 출처를 제시하는 것과 답변값이 해당 출처에서 실제로 확인되는지를 검증하는 것을 구분할 필요가 있다.
본 연구는 이러한 한계를 완화하기 위해 KDS 문서 질의응답을 위한 근거 검증형 RAG 파이프라인을 설계하고 실증하였으며, 이하 이를 EC-RAG(Engineering
Code RAG)로 지칭한다. EC-RAG는 한글(HWP) 형식의 KDS 원문을 HWPX 형식으로 변환한 뒤 조항 경로와 표의 행·셀 순서, 수식
표기를 검색에 활용할 수 있는 형태로 추출하여 검색 단위를 구성한다. 이후 키워드 기반 검색과 의미 유사도 기반 검색을 결합하여 관련 근거를 찾고,
질의 유형에 맞는 구조화된 답변과 인용문·출처를 함께 제시한다. 생성된 답변값과 단위는 인용문과 대조하며, 근거에서 이를 확인할 수 없는 경우에는
답변값을 확정적으로 제시하지 않도록 하였다.
본 연구의 공학적 기여는 다음 네 가지로 요약된다. 첫째, 자연어 질의로 설계기준의 수치·조건·규정을 확인하고, 적용되는 값과 규정을 근거 조항 및
인용문과 함께 제시하는 질의응답 방식을 구현하였다. 이를 통해 검토자가 답변의 출처를 추적하고 원문과 직접 대조할 수 있도록 하였다. 둘째, 생성된
답변값과 단위를 인용문과 대조하여 직접 확인되지 않는 값의 확정적 제시를 제한하였다. 또한 생성 모델이 표에서 값을 추정한 것으로 표시하고 해당 질의의
검색 근거에 표 검색 단위가 포함된 경우에는 원문 확인이 필요함을 알리는 경고와 함께 답변을 제시하도록 하였다. 셋째, 사전에 구축된 외부 구조화
데이터나 응용프로그램 인터페이스(API)에 의존하지 않고 공식 배포되는 KDS 원문으로부터 검색 지식베이스를 직접 구축하였다. 이에 따라 기준이 개정되면
구축된 문서 처리 파이프라인을 통해 개정 문서를 다시 처리하고 검색 인덱스를 갱신함으로써, 생성 모델을 재학습하지 않고도 변경 내용을 반영할 수 있도록
설계하였다. 넷째, 데이터 수집 시점에 확보한 568개 KDS 문서와 1,019개 평가 문항을 대상으로 전체 처리 성능과 실패 유형을 정량적으로 분석하였다.
평가 결과, 정의된 판정 기준에 따른 최종 정답률은 97.7 % (996/1,019)로 나타났다. 또한 출력 구조와 인용·검증 요건을 충족한 응답의
비율인 사후 검증 유효 응답률은 96.7 %(985/1,019)였다. 정답으로 판정되지 않은 23건 중 19건은 표 영역 처리 과정에서, 4건은 관련
근거가 검색 후보에 포함되지 않아 발생하였다. 이러한 결과는 특정 문서나 조항을 미리 지정하지 않은 자연어 질의에서도 관련 기준과 적용값을 탐색하고
그 근거를 함께 검토하는 접근의 가능성을 제시한다. 다만 본 연구의 실증 범위는 KDS 문서와 단일 의도 질의에 한정되며, 표준시방서·법령 등 다른
기술문서에 대한 적용 성능은 검증하지 않았다.
2. 관련 연구
2.1 검색증강생성(RAG)의 발전과 한계
Lewis et al.(2020)은 외부 문서 코퍼스에서 관련 단락을 검색하여 생성 모델의 근거로 활용하는 검색증강생성(Retrieval-Augmented Generation, RAG)
구조를 제안하였다. RAG는 모델의 파라미터에 저장된 지식에만 의존하는 생성 방식과 달리, 외부 지식원을 갱신함으로써 모델을 직접 재학습하지 않고도
변경된 정보를 검색 근거로 활용할 수 있다. 그러나 검색 결과를 생성 모델의 입력으로 제공하는 기본적인 RAG 구성에서는 검색된 문서가 질의와 실제로
관련되는지, 생성된 답변이 검색된 문서에 의해 뒷받침되는지를 별도로 확인하기 어렵다. 이를 보완하기 위해 검색 필요성의 판단과 검색 결과 및 생성
결과에 대한 비평을 결합한 자기 성찰 기반 RAG 구조가 제안되었으며(Asai et al., 2024), 답변의 근거 충실성(faithfulness), 답변 관련성 및 문맥 관련성을 구분하여 평가하는 프레임워크도 개발되었다(Es et al., 2024).
규범적 성격을 갖는 문서를 대상으로 하는 질의응답에서는 검색과 생성의 정확성뿐 아니라 제시된 인용문이 답변을 실제로 뒷받침하는지도 별도로 확인할 필요가
있다. Magesh et al.(2025)은 RAG를 적용한 상용 법률 검색 도구를 대상으로 한 사전등록 실험에서 응답의 정확성(correctness)과 근거성(groundedness)을
구분하여 평가하고, 인용은 제시되었으나 해당 출처가 답변의 주장을 뒷받침하지 않는 오류 유형을 제시하였다. 이 결과는 인용의 존재와 답변에 대한 근거성을
구분할 필요가 있음을 보여준다. 본 연구에서는 이러한 문제를 KDS 질의응답에 적용하여, 생성된 답변값과 단위가 인용문에서 확인되는지를 규칙 기반으로
대조하는 별도의 사후 검증 단계를 구성하였다.
2.2 텍스트-표 혼합 문서의 처리와 평가
KDS와 같은 설계기준 문서는 본문과 표, 수식이 함께 사용되므로 각 요소가 가진 구조와 문맥을 검색 가능한 형태로 표현할 필요가 있다. Smock et al.(2022)은 표의 헤더와 위치 관계를 포함한 구조 주석의 중요성을 제시하고, 약 100만 개의 표로 구성된 PubTables-1M 데이터셋을 구축하였다. Blecher et al.(2024)은 PDF 문서를 일반 텍스트로 변환하는 과정에서 특히 수식의 의미 정보가 손실될 수 있음을 지적하고, 문서 이미지를 마크업 텍스트로 변환하는 Nougat
모델을 제안하였다. 최근에는 텍스트와 표가 혼재된 문서에서 검색과 답변 생성을 함께 평가하기 위한 RAG 벤치마크도 제안되고 있다(Strich et al., 2026).
이러한 연구들은 텍스트와 표·수식이 혼재된 문서에 RAG를 적용할 때, 문서 내부의 정보를 검색 가능한 형태로 표현하는 방법과 이를 반영한 평가가
함께 고려되어야 함을 보여준다. 본 연구에서는 이러한 특성을 KDS에 적용하여 조항 경로, 표의 행 단위와 셀 순서, 수식 표기를 검색 단위에 포함하는
입력 처리 방식을 구성하였다.
2.3 국내 건설기준 디지털화 동향
국내 건설기준은 2016년 코드체계 개편 이후 국가건설기준센터를 중심으로 관리체계의 표준화와 디지털 활용체계 개선이 추진되어 왔다(Lee and Choi, 2022). 관련 연구에서는 건설기준을 설계·시공 절차, 대상 시설물, 부재 및 검토항목과 연계하여 활용하기 위한 분류체계 구축과 라이브러리화가 주요 방향으로
제시되었다. Han et al.(2023)은 설계·시공 절차, 시설물 및 부재를 기준으로 건설기준을 연계하는 라이브러리 분류체계를 제안하였고, Han et al.(2024)은 검토항목을 중심으로 관련 기준을 연결하기 위한 분류체계를 제시하였다.
최근에는 건설기준 정보를 기계적으로 활용할 수 있도록 제공 방식도 확대되고 있다. 국가건설기준센터는 KDS와 KCS의 코드 목록과 본문 정보를 조회할
수 있는 API를 제공하고 있으며, 국토교통부는 인공지능이 활용할 수 있는 디지털 건설기준 구축을 추진하고 있다(MOLIT, 2025). 이러한 변화는 건설기준의 공식 제공과 구조화, 분류체계 및 기계 간 연계 기반을 확장하는 흐름으로 볼 수 있다.
본 연구는 이러한 건설기준 디지털화 체계를 대체하거나 비교 평가하는 것이 아니라, 제공된 기준 정보를 실제 질의응답에 활용하는 단계에 초점을 둔다.
구체적으로는 자연어로 제시된 조건을 바탕으로 KDS 전체에서 관련 조항과 적용값을 검색하고, 답변과 함께 근거 조항 및 인용문을 제시한 뒤 답변값이
해당 인용문에서 확인되는지를 검증하는 RAG 접근을 다룬다. 또한 본 연구에서는 사전에 구축된 외부 구조화 데이터나 API를 필수 입력으로 사용하지
않고 공식 배포 원문에서 검색 지식베이스를 구축하였으나, 향후 구조화된 기준 데이터가 제공되는 경우 이를 검색 입력으로 연계할 수 있다.
2.4 한글(HWP) 계열 문서 형식의 처리
국내 공공부문 문서는 한글(HWP) 계열의 문서 형식으로 생산·유통되어 왔으며, 문서의 공유와 장기 보존을 위한 개방형 표준 포맷의 필요성이 논의되어
왔다(Yim, 2020). HWPX는 국가표준 OWPML을 따르는 XML 기반 개방형 문서 형식으로, 문서의 본문과 서식 등 내부 요소가 패키지 내에서 구조적으로 구분되어
저장된다(Kim, 2025). 이러한 특성은 바이너리 형식의 HWP보다 문서 내부 요소에 접근하고 구조 단위의 정보를 추출하는 데 유리하다.
반면 HWP 형식의 원문을 PDF로 변환한 뒤 일반 텍스트를 추출하는 경우에는 표의 병합 셀, 수식의 첨자와 기호, 조항 계층을 나타내는 들여쓰기
등의 정보가 평탄화될 수 있다. 다만 HWPX가 개방형 형식이라는 사실만으로 검색에 필요한 구조 정보가 자동으로 확보되는 것은 아니다. 조항 경로와
표의 행·셀 관계, 수식 표기를 검색 단위에 반영하기 위해서는 별도의 파싱 규칙이 필요하다. 이에 본 연구는 HWP 형식의 KDS 원문을 HWPX로
변환한 뒤, HWPX 변환본에서 조항 경로, 표의 행 단위와 셀 순서 및 수식 표기를 추출하여 검색 단위에 반영하였다. 구체적인 처리 절차는 4.1절에
기술한다.
2.5 문헌 고찰 및 도메인 요건에서 도출된 설계 요구사항
앞선 문헌 고찰과 설계기준 검토 업무의 특성을 종합하면, KDS를 대상으로 하는 근거 기반 질의응답 시스템의 설계 요구사항은 세 가지로 정리할 수
있다. 각 요구사항과 본 연구의 시스템 설계 요소 간 대응 관계는 Table 1과 같다.
첫째, 문서 구조를 고려한 입력 처리가 필요하다. 표와 수식이 포함된 문서에서는 헤더, 셀의 위치 관계 및 수식 표기 등이 내용 해석에 중요한 역할을
하며(Smock et al., 2022;
Blecher et al., 2024), HWP 형식의 문서를 일반 텍스트로 변환하는 과정에서는 조항 계층과 표·수식의 일부 정보가 평탄화될 수 있다(Yim, 2020;
Kim, 2025). 따라서 검색 단위에는 출처를 식별할 수 있는 조항 경로와 표의 행 단위·셀 순서, 수식 표기가 포함되어야 한다.
둘째, 답변–근거 정합성을 검증할 필요가 있다. 검색된 문서가 생성 모델의 입력에 포함되었다는 사실만으로 생성된 답변이 해당 문서에 의해 뒷받침된다고
단정할 수 없으며(Asai et al., 2024;
Es et al., 2024), 규범 문서 질의응답에서도 인용문이 제시되었으나 해당 출처가 답변을 뒷받침하지 않는 사례가 관찰되었다(Magesh et al., 2025). 이에 본 연구에서는 생성 모델의 자기 평가와 구분하여, 생성된 답변값과 단위가 인용문에서 확인되는지를 규칙 기반으로 대조하는 사후 검증 절차를
별도로 구성하였다.
셋째, 출처 추적성을 확보해야 한다. 이는 선행연구에서 직접 도출된 요건이라기보다 설계기준 검토 업무의 특성에서 비롯된다. 설계기준 질의응답의 결과는
최종 판단을 대체하기보다 검토자가 관련 원문을 확인하기 위한 출발점으로 활용되므로, 답변과 함께 출처 문서, 조항 정보 및 원문 발췌 인용문을 제시할
필요가 있다. 이를 통해 검토자는 답변이 도출된 위치를 확인하고 원문과 직접 대조할 수 있다.
Table 1. Design Requirements Derived from the Literature Review and Domain Needs
|
Design Requirement
|
Basis
|
Corresponding Approach in This Study
|
|
Structure-aware input processing
|
Smock et al. (2022), Blecher et al. (2024), Yim (2020), Kim (2025)
|
4.1 HWPX structure-aware parsing: inheritance of clause paths, preservation of row-wise
units and cell order in tables, and retention of formula notation
|
|
Answer-evidence consistency verification
|
Asai et al. (2024), Es et al. (2024), Magesh et al. (2025)
|
4.5 Post-generation evidence verification: rule-based matching between the answer
value/unit and the cited quotation
|
|
Source traceability
|
Domain requirements of design-standard review work
|
4.4 Structured answer and evidence presentation: provision of source document/clause
information and verbatim quotations from the original text
|
3. 설계기준(KDS) 문서의 구조적 특성
본 연구에서는 KDS 문서의 구조적 특성을 조항 계층, 표, 수식의 세 가지로 구분하였다.
첫째, 조항 계층 구조이다. KDS는 점 번호, 괄호 번호, 원문자 및 한글 기호 등이 결합된 다단계 번호 체계를 사용한다. 특정 수치나 조건의 적용
대상과 의미는 해당 문장이 속한 상위 조항 경로에 따라 달라질 수 있다. 따라서 검색 결과가 동일하거나 유사한 수치를 포함하더라도, 그 수치가 어떤
장·절·항에 속하는지를 함께 확인해야 한다. 본 연구에서는 이러한 출처 정보를 검색과 인용에 활용할 수 있도록 상위 조항 경로를 검색 단위의 메타데이터에
포함하였다.
둘째, 표 구조이다. KDS의 수치와 적용 조건은 다층 헤더, 병합 셀 및 조건별 구분을 포함한 표로 제시되기도 한다. 표에서 헤더와 셀의 위치 관계는
각 값의 적용 조건을 해석하는 데 중요한 정보이며(Smock et al., 2022), 표를 일반 텍스트로 변환하면 행과 열의 대응 관계를 파악하기 어려워질 수 있다. 다만 본 연구는 병합 셀 계층을 완전하게 복원하는 대신, 표의
행 단위와 셀 순서를 유지하여 검색 단위를 구성하였다.
셋째, 수식 표현이다. KDS에서는 설계 공식과 허용치가 첨자, 괄호 및 기호를 포함한 수식 객체로 표현되기도 한다. 문서를 PDF나 일반 텍스트로
변환하는 과정에서는 이러한 표기가 평탄화되어 검색과 인용 과정에서 수식의 일부 의미가 손실될 수 있으며, 유사한 문제는 학술 문서 파싱 연구에서도
지적되어 왔다(Blecher et al., 2024). 본 연구에서는 수식의 수학적 의미 구조를 복원하기보다, 원문에 표시된 수식 표기를 검색 가능한 형태로 유지하였다.
이러한 특성은 KDS 문서를 검색 가능한 형태로 변환할 때 포함해야 할 정보의 범위를 결정한다. 공식 배포 자료는 한글(HWP) 형식의 KDS 원문이며,
본 연구에서는 바이너리 형식의 HWP보다 XML 요소에 직접 접근할 수 있는 HWPX 형식이 조항·표·수식 정보를 처리하는 데 적합하다고 판단하였다.
이에 따라 HWP 형식의 KDS 원문을 HWPX로 변환한 뒤, HWPX 변환본에서 조항 경로, 표의 행 단위와 셀 순서 및 수식 표기를 추출하여 검색
단위에 반영하였다(Kim, 2025). 구체적인 처리 절차는 4장에서 기술한다.
조항 계층은 문서에 명시된 번호 표기를 기준으로 인식하였다. 본 연구의 처리 절차는 제n장, 제n절, 제n조, 제n항, 제n편과 둘 이상의 숫자 계층을
점으로 연결한 번호 형식(예: 4.2, 4.2.1)을 대상으로 상위 조항 경로를 추적한다. 인식되지 않은 번호 표기는 조항 헤더로 채택하지 않으며
해당 구간에서는 조항 경로 정보의 정확성이 제한될 수 있다. 잘못 표기된 번호의 자동 교정이나 표준과 다른 번호 체계의 복원은 본 연구의 범위에 포함하지
않았다. 평가는 공식 배포된 KDS 문서를 대상으로 수행하였으며, 비표준 번호나 표기 오류를 별도로 삽입한 강건성 평가는 수행하지 않았다.
4. EC-RAG 시스템 설계
EC-RAG는 Fig. 1과 같이 HWPX 구조 고려형 파싱, 인덱싱, 하이브리드 검색, 질의 유형 라우팅, 구조화 답변 생성 및 사후 검증의 6단계로 구성된다. 앞의 두
단계는 질의 입력 전에 수행되는 문서 처리 과정이며, 뒤의 네 단계는 질의가 입력될 때마다 수행되는 응답 생성 과정이다. 이들 단계는 2.5절에서
도출한 문서 구조 고려, 답변–근거 정합성 검증 및 출처 추적성 요구사항을 구현한다. 이하에서는 각 단계의 목적과 처리 내용을 기술한다.
Fig. 1. Overall Architecture and Processing Flow of the Proposed EC-RAG System: (A)
Offline Document Processing (Stages 1-2) and (B) Online Query Processing (Stages 3-6).
According to the Output Policy Applied at the Verification Stage, a Response is Routed
to Confirmed Output, Warning Output, or Restricted Response
4.1 HWPX 구조 고려형 파싱
본 연구에서 HWPX 파싱은 HWP 형식의 KDS 원문을 HWPX 형식으로 변환한 뒤, HWPX 내부의 XML 요소를 직접 처리하는 방식을 의미한다.
이 단계의 목적은 이후의 검색, 답변 생성 및 검증에 필요한 정보를 검색 단위에 포함하는 것이다. 입력 단계에서 누락된 문서 구조를 후속 검색이나
생성 과정에서 복원하기는 어렵기 때문에, 문서 처리는 전체 파이프라인의 기반이 된다.
처리 내용은 세 가지이다. 첫째, XML에서 조항 헤더를 인식하여 상위 조항 경로를 추적하고 이를 각 검색 단위의 메타데이터로 부여한다. 이때 표
셀에 포함된 수치나 수식 조각이 조항 헤더로 잘못 인식되지 않도록 번호 형식, 문자 구성 및 문자열 길이 등에 관한 판별 조건을 적용한다. 둘째,
표를 구성하는 hp:tbl과 hp:tc 요소를 처리하여 표의 행 단위와 셀 순서를 유지한 텍스트 표현으로 변환한다. 셋째, 첨자, 상첨자 및 연산자가
포함된 수식 표기를 검색 가능한 텍스트로 변환한다.
따라서 이 단계에서는 HWPX 변환본에서 문서 식별정보와 조항 경로를 추출하고, 본문 문단과 표의 행 단위·셀 순서 및 수식 표기를 검색 가능한 형태로
구성한다. 다만 병합 셀의 계층 관계를 완전하게 복원하지는 않으며, 이에 따른 다층 헤더 표의 처리 한계는 6.4절에서 분석한다. 수식 또한 검색과
인용이 가능한 텍스트 표현으로 변환하는 것이며, 수학적 의미 구조를 완전하게 복원하는 것은 아니다.
4.2 인덱싱과 하이브리드 검색
구조 고려형 파싱을 거친 문서는 검색 단위로 구성되어 두 종류의 인덱스에 등록된다. 하나는 BM25 기반의 키워드 검색(Robertson and Zaragoza, 2009)을 위한 희소 인덱스이고, 다른 하나는 BGE-M3 임베딩(Chen et al., 2024)을 이용한 의미 유사도 검색용 밀집 인덱스이다. 표는 내부의 행 단위와 셀 순서가 분할 과정에서 끊기지 않도록 표 전체를 하나의 검색 단위로 유지한다.
두 검색 방식을 함께 사용하는 이유는 설계기준 질의에서 정확한 용어 일치와 의미적 유사성이 모두 필요하기 때문이다. 예를 들어 ‘재료계수’나 ‘극한인발력’과
같이 기준에 사용된 고유 용어는 표기가 일치할 때 효과적으로 검색할 수 있다. 반면 실무자가 사용하는 표현과 기준 문서의 표현이 다른 경우에는 의미
유사도에 기반한 검색이 필요하다.
본 시스템은 희소 인덱스와 밀집 인덱스를 각각 검색한 뒤, 두 결과의 순위를 Reciprocal Rank Fusion 방식으로 결합한다(Cormack et al., 2009). 이를 통해 한 검색 방식에서만 높은 순위를 얻은 문서도 최종 후보에 포함될 수 있도록 하였다. 융합된 상위 검색 결과는 구조화 답변 생성 단계의
근거로 제공된다.
4.3 질의 유형 라우팅
설계기준 질의는 하나의 수치를 묻는 질의, 조건에 따라 달라지는 값을 묻는 질의, 준수해야 할 규정을 묻는 질의 및 용어의 정의를 묻는 질의 등으로
구분할 수 있다. 이러한 질의들은 필요한 답변의 구성도 서로 다르다. 모든 질의에 동일한 응답 형식을 적용하면 수치 질의에 불필요한 서술형 답변이
생성되거나, 정의 질의에서 존재하지 않는 수치 필드를 생성하는 등의 형식 불일치가 발생할 수 있다.
본 시스템은 답변을 생성하기 전에 질의 유형을 판별하고, 해당 유형에 맞는 출력 구조를 선택한다. 질의 유형의 판단은 생성 모델이 수행하며, 정의형처럼
표현이 비교적 정형화된 일부 유형에는 규칙 기반 보정을 함께 적용한다.
다만 본 라우팅은 하나의 주요 의도를 가진 단일 의도 질의를 전제로 한다. 서로 독립적인 복수의 질문을 포함하여 질의를 하위 질문으로 분해하고 결과를
종합해야 하는 다중 의도 질의는 본 연구의 처리 및 평가 범위에 포함하지 않았다.
4.4 구조화 답변 생성과 인용 근거 제시
생성 모델의 응답은 정해진 JSON 형식을 따르도록 하였다. JSON은 항목의 이름과 값을 쌍으로 표현하는 구조화된 데이터 형식이며, 본 시스템에서는
답변값, 적용 조건 및 인용 근거를 서로 구분된 필드로 저장한다.
응답 구조는 4.3절에서 판별한 질의 유형에 따라 달라진다. 단일 수치형은 답변값과 적용 조건을, 조건부 수치형은 질의 조건에 해당하는 값과 조건별
값의 목록을 포함한다. 정의형은 정의 문장을, 규정형은 요구사항의 목록을 반환한다. 또한 응답에는 판단에 사용한 인용문과 출처 정보를 함께 포함하도록
하였다. 인용문은 해당 질의에서 검색된 근거의 원문을 그대로 발췌하도록 하고, 생성 모델이 이를 요약하거나 재서술하지 않도록 하였다.
답변을 구조화한 이유는 두 가지이다. 첫째, 답변값과 적용 조건을 별도의 필드로 구분하면 사후 검증에서 대조할 답변값을 명확하게 식별할 수 있다.
둘째, 조건에 따라 값이 달라지는 질의에서는 질의 조건에 해당하는 값과 동일 조항에 포함된 다른 조건의 값을 구분하여 제시할 수 있다.
예를 들어 하천 횡단 철도교량의 다리밑 공간을 묻는 질의에서는 질의에 제시된 범선 통과 조건의 값을 주 답변값으로 제시하고, 같은 조항에 규정된 대기선
군함, 소증기선 및 폰툰·바지선 조건의 값을 함께 반환하였다. 이는 조건별 값을 구분하는 출력 구조의 적용 사례로, 검토자가 각 값의 적용 조건을
원문과 대조할 수 있도록 한 것이다.
4.5 사후 검증
생성된 답변에 인용문이 포함되어 있다는 사실만으로 해당 인용문이 답변값을 실제로 뒷받침한다고 단정할 수는 없다. 본 시스템은 생성 모델의 자기 평가와
분리된 규칙 기반 절차를 통해 답변값과 인용문을 대조한다.
검증은 두 단계로 구성된다.
첫째는 인용문 출처 확인이다. 응답에 포함된 인용문이 해당 질의에서 실제로 검색된 근거에 존재하는지를 검사한다. 인용문과 검색 근거를 정규화한 뒤
직접적인 포함 관계를 우선 확인하며, 표기 차이로 인해 직접 일치하지 않는 경우에는 두 문자열의 최장 공통 부분이 인용문에서 차지하는 비율을 이용하여
완화된 일치 여부를 판정한다. 정규화 대상에는 공백, 전각·반각 문자, 범위 및 비교 기호, 괄호 등 동일한 내용이 서로 다르게 표현될 수 있는 요소가
포함된다. 인용문이 검색 근거에서 확인되지 않으면 해당 응답은 확정 출력 대상에서 제외한다.
둘째는 답변값 근거 확인이다. 수치형 질의에 대해 응답의 값 필드에 포함된 수치와 단위가 앞 단계에서 확인된 인용문 안에 존재하는지를 검사한다. 값
필드가 비어 있는 경우에는 답변값을 제시하지 않는 제한 응답으로 처리한다. 반면 답변값이 제시되었으나 해당 수치 또는 단위를 인용문에서 확인할 수
없는 경우에는 검증 실패로 판정하여 확정 출력에서 제외한다. 이 검사는 답변값과 단위를 대상으로 하며, 적용 조건 필드의 서술이 인용문의 조건과 의미적으로
일치하는지는 판정하지 않는다. 조건 서술은 표현 방식이 다양하여 규칙 기반 대조 과정에서 오판정이 발생할 수 있으므로, 조건 일치 여부의 자동 검증은
후속 연구 범위로 남겼다.
검증 결과에 따라 응답은 확정 출력, 경고 출력 또는 제한 응답으로 구분된다. 인용문과 답변값이 모두 확인된 경우에는 확정 출력으로 처리하고, 답변값을
인용문에서 확인할 수 없는 경우에는 확정적 제시를 제한한다. 또한 생성 모델이 표에서 값을 추정한 것으로 표시하고 해당 질의의 검색 근거에 표 검색
단위가 포함된 경우에는, 원문 확인이 필요함을 알리는 경고 출력으로 처리한다.
사후 검증의 목적은 생성 답변의 정답률을 직접 높이는 것이 아니라, 검색 근거에서 확인되지 않은 값이 확정적인 답변으로 제시되는 경우를 줄이는 것이다.
따라서 사후 검증 결과는 답변 내용의 정답 여부와 구분되는 별도의 평가 지표로 제시한다.
5. 평가 방법
5.1 인덱싱 범위 및 실험 환경
본 연구에서는 데이터 수집 시점에 확보한 568개의 KDS 원문 파일을 대상으로 검색 지식베이스를 구축하였다. HWP 형식의 원문을 HWPX 형식으로
일괄 변환한 뒤, 4.1절에서 기술한 구조 고려형 파싱을 적용하여 본문 문단, 표 및 수식 요소를 추출하였다. 또한 상위 조항 번호의 계층적 위치를
나타내는 조항 경로를 메타데이터로 부여하고, 문서를 총 50,862개의 검색 단위(이하 청크)로 구성하였다. 본문은 일정한 길이를 기준으로 분할하였으나,
표는 내부의 행 단위와 셀 순서가 분할 과정에서 끊기지 않도록 표 전체를 하나의 독립 청크로 유지하였다. 각 청크는 BM25 기반 희소 인덱스와 BGE-M3
기반 밀집 인덱스에 모두 등록하였다.
질의가 입력되면 두 인덱스를 각각 검색한 뒤 Reciprocal Rank Fusion(RRF)으로 순위를 결합하고, 결합 결과의 상위 20개 청크를
생성 모델의 검색 근거로 제공하였다. 평가 질의에는 특정 KDS 코드나 조항 경로를 포함하지 않았으며, 검색 범위도 특정 문서로 제한하지 않고 전체
검색 인덱스를 대상으로 하였다. 주요 실험 환경은 Table 2와 같다.
Table 2. Experimental Configuration
|
Item
|
Configuration
|
Note
|
|
Target documents
|
568 KDS files
|
Indexed after HWPX conversion
|
|
Retrieval unit
|
50,862 chunks
|
Tables kept as independent chunks without splitting
|
|
Sparse retrieval
|
BM25
|
Keyword-based retrieval
|
|
Dense retrieval
|
BGE-M3 embedding
|
Semantic similarity
|
|
Fusion method
|
RRF (k = 60)
|
Rank fusion of the two retrieval results
|
|
Retrieval evidence
|
Top 20 retrieved chunks
|
Top-ranked results of RRF fusion
|
|
Generation model
|
Qwen3-32B
|
vLLM, bfloat16, max context 32,768 tokens
|
|
Generation parameters
|
Temperature 0.6, top-p 0.95, top-k 20, max generation 4,096 tokens
|
Random seed not fixed
|
|
Hardware
|
NVIDIA A100 40GB × 4
|
Tensor parallelism 4
|
5.2 QA 평가셋 구축
시스템의 정량 평가를 위해 KDS 원문을 근거로 하는 1,019개 문항의 QA 평가셋을 자체 구축하였다. 설계기준 질의응답에서는 생성 문장의 유창성보다
원문에서 관련 근거를 검색하고 그 근거에 부합하는 답변을 생성하는 능력이 중요하다. 이에 따라 문항 작성과 검수에는 다음 세 가지 원칙을 적용하였다.
첫째, 명시적 근거의 원칙이다. 정답 또는 정답을 구성하는 핵심 내용은 KDS 원문에 명시적으로 존재해야 한다. 문서 간 연계, 별도의 계산 또는
해석·추론을 거쳐야만 도출할 수 있는 내용은 평가 대상에서 제외하였다. 이는 생성된 답변을 원문과 직접 대조하고, 답변에 제시된 근거의 적절성을 확인하기
위한 것이다.
둘째, 객관적 판정의 원칙이다. 정답은 수치, 단위, 조항명, 고유 용어 또는 제한된 항목의 열거와 같이 기준답안과 객관적으로 대조할 수 있는 형태로
구성하였다. 자유로운 설명이나 요약을 요구하는 서술형 질문은 채점자의 해석이 개입될 가능성이 있으므로 평가 대상에서 제외하였다.
셋째, 검색 의존성의 원칙이다. 문항은 일반적인 상식만으로 답하기 어렵고, 해당 KDS에 제시된 구체적인 수치, 조건 또는 규정을 확인해야 답할 수
있도록 구성하였다. 예를 들어 일반적인 개념의 정의를 묻는 질문은 제외하고, 특정 적용 조건과 결합된 설계기준의 수치·규정 또는 KDS 원문에 정의된
용어를 묻는 질문을 포함하였다.
이러한 원칙에 따라 평가 문항을 단순 수치형, 조건부 수치형, 규정형 및 정의형의 네 유형으로 구성하였다. 단순 수치형은 특정 기준값을 묻고, 조건부
수치형은 질의에 주어진 조건에 해당하는 값을 묻는다. 규정형은 한계값이나 준수 사항을 확인하며, 정의형은 KDS 원문에서 정의된 명칭이나 용어를 묻는다.
이유에 대한 설명이나 원문 내용의 요약을 요구하는 질문은 포함하지 않았다. 기준답안에는 부연 설명을 최소화하고 원문에 제시된 핵심 값이나 용어를 기록하였으며,
각 문항에는 기준답안의 출처인 KDS 코드와 조항 번호를 함께 명시하였다.
평가 문항은 KDS 원문을 입력으로 대규모 언어모델을 활용하여 초안을 생성한 뒤 연구자가 검수·확정하였다. 원문에서 답을 직접 확인할 수 있는 단순
수치형, 조건부 수치형, 규정형 및 정의형 질의를 대상으로 하였으며, 문서 간 연계나 외부 데이터 결합, 별도의 계산·추론이 필요한 문항은 제외하였다.
KDS 대분류별 문항 분포를 점검하여 상대적으로 문항 수가 적은 분야를 보완하였고, 동일하거나 실질적으로 중복되는 문항은 제거하였다. 또한 원문에서
기준답안을 명확하게 확인할 수 없거나 정답 판정 기준이 모호한 문항은 평가셋에 포함하지 않았다.
이 절차를 거쳐 18개 KDS 대분류에 걸친 1,019개 문항을 확정하였으며, 질문 유형과 근거 유형의 분포는 각각 Table 3과 Table 4와 같다. 질문 유형별로는 단순 수치형이 700개로 가장 많았고, 적용 조건이 결합된 조건부 수치형은 164개로 전체의 16.1 %를 차지하였다.
조건부 수치형은 관련 조항을 검색하는 것만으로는 답하기 어렵고, 질의에 제시된 조건에 해당하는 값을 구분해야 한다는 점에서 설계기준 질의응답의 특성을
평가하는 문항이다.
Table 3. Distribution of Question Types (n = 1,019)
|
Question Type
|
Count (Ratio)
|
Description
|
|
Simple numeric
|
700 (68.7 %)
|
Confirming a specific value in a single clause
|
|
Conditional numeric
|
164 (16.1 %)
|
Identifying the value corresponding to the applicable condition
|
|
Provision
|
126 (12.4 %)
|
Confirming compliance items or target items
|
|
Definition
|
29 (2.8 %)
|
Confirming a name or term defined in the original text
|
|
Total
|
1,019 (100.0 %)
|
|
Table 4. Distribution by Evidence Type of the Reference Answer (n = 1,019)
|
Evidence Type
|
Count (Ratio)
|
Description
|
|
Body clause
|
883 (86.7 %)
|
Value or provision stated in the clause body
|
|
Table
|
133 (13.1 %)
|
Cell value corresponding to a condition in a table
|
|
Formula
|
3 (0.3 %)
|
Coefficient or variable value given in a formula
|
|
Total
|
1,019 (100.0 %)
|
|
기준답안의 근거 유형별로는 본문 조항이 883개로 가장 많았으며, 표에서 조건에 해당하는 셀 값을 확인해야 하는 문항은 133개였다. 수식이 근거인
문항은 3개로 표본 수가 적기 때문에, 해당 영역의 성능을 독립적으로 판단하기에는 한계가 있다. 표 기반 문항의 분포는 6.4절에서 제시하는 미해결
사례의 원인과 함께 분석하였다.
평가 문항의 구체적인 형태는 Table 5와 같다. 각 문항은 질문, 기준답안, 근거 KDS 코드 및 조항 번호로 구성된다. 기준답안은 생성 답변의 정답 여부를 판정하는 데 사용하였으며 근거
KDS 코드와 조항 번호는 판정이 명확하지 않은 사례에서 원문을 확인하는 기준으로 사용하였다.
Table 5. Representative Items of the Evaluation Set
|
Question Type
|
Question
|
Reference Answer
|
Source Clause
|
|
Simple numeric
|
What is the required safety factor against tension and shear under normal conditions
in the internal stability review of a nail in a slope reinforcement method?
|
2
|
KDS 11 70 15, 4.1.1 (2), Table 4.1-1
|
|
Conditional numeric
|
In reinforced-earth retaining wall design, for temporary structures with a design
life of how many months or less may a geosynthetic-wrapped facing be applied?
|
36 months or less
|
KDS 11 80 10, 3.1.1 (1) ①
|
|
Provision
|
In nail-reinforced slope design, which facilities, including weep holes and horizontal
drains, must be considered to exclude the effect of water pressure?
|
Drainage facilities (weep holes, horizontal drains, vertical drainage material, drainage
channels)
|
KDS 11 70 15, 4.1.5 (1), (2)
|
|
Definition
|
In steel-structure fatigue design, which stress is defined as being excluded from
consideration for details subject to net tensile stress?
|
Residual stress
|
KDS 14 31 20, 4.1.2.1 (2)
|
5.3 평가 지표 및 정답 판정 기준
1,019개 문항 전체에 대해 배치 평가를 수행하였다. 본 연구에서는 생성 답변의 내용이 기준답안과 일치하는지를 확인하는 정답 판정과, 생성 답변에
포함된 인용문이 답변값을 뒷받침하는지를 확인하는 사후 검증을 구분하였다. 정답 판정은 시스템 성능을 측정하기 위한 평가 절차이고, 사후 검증은 생성
결과에 대한 출력 여부를 결정하는 시스템 구성요소이다. 두 절차는 목적과 판정 대상이 다르므로 각각 별도의 지표로 보고하였다.
정답 판정은 생성 답변을 기준답안과 대조하여 수행하였다. 먼저 생성 답변과 기준답안의 표기상 일치 여부를 확인하고, 소수점 자릿수, 백분율, 단위
표기, 적용 조건 및 예외 규정 등의 차이로 판정이 명확하지 않은 사례는 연구자가 기준답안과 근거 조항을 직접 확인하여 Table 6의 기준에 따라 판정하였다.
Table 6. Answer Judgment Criteria
|
Category
|
Criteria
|
|
Accepted as correct
|
· Same numerical value expressed with different numbers of decimal places (e.g., 2
and 2.0) · Percentage and decimal expressions representing the same value (e.g., 0.1 and 10
%) · Different unit notations, or values confirmed identical after unit conversion · A table-cell value and unit expressed in separated or combined form · Semantic identity directly confirmable in the reference answer or source clause
|
|
Treated as incorrect
|
· An applicable condition required by the query is omitted · A necessary exception provision is omitted from the answer · The value, unit, or target of application differs from the reference answer · A meaning not confirmable in the reference answer or source clause is added · No answer corresponding to the reference answer is generated
|
이러한 확인 절차가 필요한 이유는 동일한 답이 서로 다른 형식으로 표현될 수 있기 때문이다. 예를 들어 기준답안이 ‘2’인 문항에 대해 시스템이 원문의
표기를 따라 ‘2.0’으로 답한 경우 두 값은 동일하지만 단순 문자열 비교에서는 불일치로 처리된다. 백분율과 소수 표현이 혼용되거나, 표 셀의 값과
단위가 서로 다른 필드에 저장되는 경우에도 같은 문제가 발생한다. 이러한 형식 차이를 오답으로 처리하지 않도록 Table 6의 동등성 판정 기준을 적용하였다.
사후 검증은 정답 판정과 별개로, 생성 답변에 포함된 인용문이 답변값과 단위를 실제로 뒷받침하는지를 규칙 기반으로 대조하는 절차이다. 검증 결과에
따라 응답은 확정 출력, 경고 출력 또는 제한 응답으로 처리된다. 답변값과 단위가 인용문에서 확인되면 확정 출력이 가능하며, 생성 모델이 표에서 값을
추정한 것으로 표시하고 해당 질의의 검색 근거에 표 청크가 포함된 경우에는 원문 확인이 필요함을 알리는 경고 출력으로 처리한다.
값 필드가 비어 있는 경우에는 답변값을 제시하지 않는 제한 응답으로 처리한다. 이는 근거가 충분하지 않은 상황에서 값을 생성하지 않고 검증 정책에
따라 정상적으로 처리된 응답이므로 유효 응답에 포함하였다. 반면 답변값이 제시되었으나 해당 수치 또는 단위를 인용문에서 확인할 수 없는 경우에는 검증
실패로 판정하여 비유효 응답으로 처리하였다. 요구된 출력 구조나 필수 인용 요건을 충족하지 못한 응답도 비유효 응답에 포함하였다.
사후 검증 유효 응답률은 전체 문항 가운데 출력 구조, 인용 요건 및 검증 정책에 따라 정상적으로 처리된 응답의 비율로 정의하였다. 이 지표는 답변
내용의 정답 여부가 아니라, 응답이 시스템의 출력·검증 정책을 충족했는지를 나타낸다.
따라서 본 논문에서 보고하는 최종 정답률과 사후 검증 유효 응답률은 서로 다른 평가 기준에 기반한 별개의 지표이다. 전자는 생성 답변의 내용이 기준답안과
일치하는지를 나타내고, 후자는 생성된 응답이 요구된 형식과 인용·검증 요건에 따라 처리되었는지를 나타낸다. 두 지표는 서로 배타적인 분류가 아니므로,
두 값의 차이를 별도의 오류 건수로 해석하지 않았다.
6. 실험 결과
6.1 정량 평가 결과
1,019개 평가 문항 전체에 대한 배치 평가 결과는 Table 7과 같다.
Table 7. Evaluation Results of EC-RAG on 1,019 KDS QA Items
|
Evaluation Item
|
Result
|
Meaning
|
|
Final answer accuracy
|
97.7 % (996/1,019)
|
Ratio of responses judged, per the criteria in Section 5.3, to have core content matching
the reference answer
|
|
Valid response rate under post-generation evidence verification
|
96.7 % (985/1,019)
|
Ratio of responses processed normally according to the output structure, citation
requirements, and verification policy
|
|
Cases not judged correct
|
23 (2.3 %)
|
Cases still not matching the reference answer after final answer judgment
|
평가 질의에는 특정 KDS 코드나 조항 경로를 포함하지 않았으며, 검색 범위도 특정 문서로 제한하지 않았다. 시스템은 각 질의에 대해 전체 검색 인덱스에서
관련 근거를 탐색하였다. 이는 사용자가 참조해야 할 기준 문서나 조항을 사전에 지정하지 않은 조건에서 전체 파이프라인의 성능을 평가하기 위한 것이다.
최종 정답으로 판정되지 않은 23건의 원인은 6.4절에서 분석하였다. 이 가운데 19건은 표 영역에서 질의 조건에 해당하는 값을 식별하는 과정에서
발생하였고, 4건은 정답 근거가 검색 후보에 포함되지 않아 발생하였다.
6.2 질의응답 사례
EC-RAG의 전체 처리 과정을 구체적으로 설명하기 위해 평가 문항 No. 101이 자연어 질의에서 최종 응답으로 처리되는 과정을 Fig. 2에 제시하였다. 해당 문항은 콘크리트를 거푸집 하부에서 주입하는 역타설 조건에서 최소 측압에 추가로 고려해야 하는 비율을 묻는다. 질의에는 기준 문서나
조항 정보가 포함되지 않았으며, 시스템은 전체 검색 인덱스에서 관련 근거를 검색하였다. 이후 조건에 해당하는 답변값과 인용문을 생성하고, 답변값이
인용문에서 확인되는지를 사후 검증하여 확정 출력으로 처리하였다.
Fig. 2. Representative End-to-end EC-RAG Case for Question No. 101
Fig. 2는 실제 평가 기록을 바탕으로 처리 과정을 재구성한 것이다. 검색 단계에서는 근거 문서인 KDS 21 50 00이 확인되었으며, 원문 조항 위치인
1.6.3 (8)은 평가 과정에서 공식 KDS 원문과 대조하여 확인하였다. 최종 응답에는 답변값 및 적용 조건과 함께 근거 조항과 원문 발췌 인용문이
제공된다.
질의 유형에 따른 실제 생성 결과는 Table 8에 제시하였다. Table 5가 평가 문항과 기준답안의 구성을 보여주는 데 비해, Table 8은 시스템이 실제로 생성한 답변과 판단에 사용된 인용 근거를 보여준다. 각 사례에서 사용자는 특정 기준 문서나 조항을 지정하지 않았으며, 시스템은
전체 검색 인덱스에서 관련 근거를 검색하여 답변과 함께 제시하였다.
Table 8. Representative Question-Answering Cases
|
Type
|
Query
|
System Answer
|
Source Clause and Key Quotation
|
|
Table condition identification
|
What is the required safety factor for tension and shear under normal conditions in
the internal stability review of a nail in a slope reinforcement method?
|
2.0 (condition: normal)
|
KDS 11 70 15, Table 4.1-1 “| Internal stability | Tension and shear of nail | Normal | 2.0 |”
|
|
Condition-specific values
|
In planning a river-crossing railway bridge, what is the minimum vertical clearance
(m) above the highest water level for the passage of sailing vessels?
|
30 m (passage of sailing vessels or small vessels); also presented: large steamships
or warships 45–60 m, small steamships 4.5 m, pontoons/barges 3.0 m
|
KDS 47 10 15, 2.3.2 “a. Passage of sailing vessels or small vessels … 30 m above the
highest water level”
|
|
Conditional provision
|
In lap-splice design of compressive deformed bars, how is the splice length corrected
when the specified compressive strength of concrete is below 21 MPa?
|
Increase the lap-splice length by 1/3
|
KDS 14 20 52, 4.5.3 “When the specified compressive strength is below 21 MPa, the
lap-splice length shall be increased by 1/3”
|
|
Requirement enumeration
|
In nail-reinforced slope design, which facilities must be considered to exclude the
effect of water pressure?
|
Drainage facilities: ① weep holes ② horizontal drains ③ vertical drainage material
behind the facing ④ drainage channel atop the facing
|
KDS 11 70 15, 4.1.5 “The types of drainage facilities applied in the nailing method
are as follows”
|
|
Definition confirmation
|
In the durability design of marine concrete, what is the point defined as the limit
state?
|
The state in which the chloride-ion concentration at the reinforcement reaches the
critical chloride-ion concentration and corrosion of the reinforcement begins
|
KDS 24 14 22, 4.5.5.2 “… the state in which corrosion of the reinforcement begins
is taken as the limit state”
|
첫 번째 사례는 하나의 표에 검토 대상, 검토 항목 및 하중 조건별 기준값이 함께 제시된 경우이다. 관련 표를 검색한 뒤에도 질의에 포함된 조건을
구분하여 해당 셀의 값을 식별해야 한다. 두 번째 사례는 질의 조건에 해당하는 값을 주 답변으로 제시하면서 동일 조항에 포함된 다른 조건의 값도 구분하여
반환한 경우이다.
세 번째 사례에서는 특정 조건이 충족될 때 적용해야 하는 설계 조치를 제시하였고, 네 번째 사례에서는 원문에 열거된 복수의 요구사항을 구조화하여 반환하였다.
다섯 번째 사례는 원문에서 정의된 상태를 확인하여 제시한 경우이다. 이들 사례는 EC-RAG가 단순 수치뿐 아니라 조건별 수치, 적용 규정, 요구사항
및 정의를 질의 유형에 맞는 형태로 반환하고, 각 답변의 출처와 인용문을 함께 제시하도록 구성되었음을 보여준다.
6.3 근거가 충분하지 않은 질의에 대한 응답 제한
EC-RAG는 사후 검증 결과에 따라 응답을 확정 출력, 경고 출력 또는 제한 응답으로 처리하도록 설계하였다. 이러한 출력 정책의 목적은 정답률을
직접 높이는 것이 아니라, 검색 근거에서 확인되지 않은 값이 확정적인 답변으로 제시되는 경우를 줄이는 데 있다.
실제 평가에서도 정답이 포함된 청크가 검색 후보에 포함되지 않아 답변값을 확인할 수 없는 경우, 시스템은 임의의 값을 생성하지 않고 값 필드를 비운
제한 응답을 반환하였다. 이때 시스템은 검색된 근거와 함께 답변값을 확정할 수 없다는 사실을 제시하였다. 이러한 사례는 기준답안과 일치하는 값을 제공하지
못했으므로 정답으로 판정되지는 않았지만, 근거가 불충분한 상황에서 값을 생성하지 않았다는 점에서 사후 검증 정책에 따라 정상적으로 처리된 유효 응답에
포함하였다.
따라서 응답 제한 특성은 최종 정답률과 구분하여 해석해야 한다. 이는 시스템이 모든 질의에 답변값을 생성하는지를 나타내는 것이 아니라, 답변값을 뒷받침하는
근거가 확인되지 않을 때 확정적 출력을 제한하는지를 보여주는 특성이다.
6.4 미해결 사례 분석
최종 정답으로 판정되지 않은 23건의 원인을 분석한 결과는 Table 9와 같다. 미해결 사례는 표 영역 처리 한계 19건과 검색 단계 한계 4건으로 분류하였다.
Table 9. Classification of the 23 Unresolved Cases
|
Classification
|
Count
|
Ratio of Total Questions
|
|
[A] Table-region processing limitation
|
19
|
1.9 %
|
|
[B] Retrieval-stage limitation
|
4
|
0.4 %
|
|
Total
|
23
|
2.3 %
|
미해결 사례 23건 중 19건이 표 영역에서 발생하였다. 평가셋에서 표를 근거로 하는 문항은 133건이었으나, 전체 미해결 사례의 대부분이 이 유형에
집중되었다. 이는 본문 조항에 서술된 값을 처리하는 경우보다 다층 헤더와 병합 셀을 포함한 표에서 질의 조건에 해당하는 값을 식별하는 과정이 상대적으로
취약했음을 나타낸다. 두 유형의 구체적인 사례는 Table 10에 제시하였다.
Table 10. Representative Unresolved Cases by Category
|
Classification
|
Query
|
Reference Answer / Generated Answer / Final Handling
|
Cause
|
|
[A] Table-region processing limitation
|
What is the design speed for an expressway classified as a major arterial road in
an urban area?
|
100 km/h / 120 km/h / Final answer withheld
|
The relevant document KDS 44 10 00 and its table were retrieved, but in a multi-level
header combining regional division and road class, the generation model selected 120
km/h, the value of an adjacent condition. Since the generated value could not be confirmed
in the quotation attached to the response, post-hoc verification withheld the final
answer.
|
|
[B] Retrieval-stage limitation
|
What value is applied for the single rear-wheel load (P) of the design vehicular live
load in live-load bending-moment calculation?
|
96 kN / No value generated / Restricted response
|
The relevant chunk of KDS 24 10 11 containing the answer was not included among the
top retrieval candidates. The system did not generate an answer value and returned
a restricted response presenting only the retrieved evidence.
|
[A] 사례에서는 관련 문서와 표가 검색되었지만, 생성 단계에서 다층 헤더의 조건을 잘못 결합하여 인접한 셀의 값을 선택하였다. 이는 표를 하나의
검색 단위로 유지하는 것만으로는 복수의 행·열 조건이 결합된 셀을 안정적으로 식별하기 어렵다는 점을 보여준다. 향후에는 병합 셀과 다층 헤더의 관계를
명시적으로 표현하고, 질의 조건과 표의 행·열 조건을 대응시키는 처리 절차가 필요하다.
[B] 사례에서는 정답 근거가 상위 검색 후보에 포함되지 않아 생성 모델에 전달되지 않았다. 이 경우 시스템은 기준답안에 해당하는 값을 제공하지 못했지만,
근거에서 확인되지 않은 값을 임의로 생성하지 않고 제한 응답을 반환하였다. 따라서 [B]는 검색 성능의 한계에 해당하며, 검색 후보의 재순위화나 질의
확장 등을 통해 보완할 필요가 있다.
두 사례는 모두 최종 정답을 제공하지 못했다는 점에서 미해결 사례로 분류되지만, 발생 단계와 시스템의 처리 결과는 서로 다르다. [A]는 정답 근거가
검색된 이후 표 내부의 조건을 잘못 해석한 사례이며, [B]는 정답 근거가 생성 단계에 전달되지 않은 사례이다.
7. 연구의 한계 및 향후 연구
본 연구의 한계는 다음의 다섯 가지로 정리할 수 있다.
첫째, 표 영역 처리의 한계이다. 최종 정답으로 판정되지 않은 23건 중 19건은 다층 헤더와 복수의 조건이 결합된 표에서 질의 조건에 해당하는 셀을
식별하거나, 표에서 생성된 답변값을 인용 근거와 대조하는 과정에서 발생하였다. 본 연구에서는 표 전체를 하나의 검색 단위로 유지하고 행 단위와 셀
순서를 반영하였으나, 병합 셀과 다층 헤더의 의미 관계를 완전하게 복원하지는 않았다. 향후에는 병합 셀과 헤더 계층을 명시적으로 표현하고, 질의 조건을
표의 행·열 조건과 대응시키는 처리 및 검증 절차가 필요하다.
둘째, 검색 단계의 한계이다. 희소 검색과 밀집 검색의 결과를 순위 융합하였음에도 정답 근거가 생성 모델에 제공되는 상위 검색 후보에 포함되지 않은
사례가 4건 발생하였다. 향후에는 검색 후보의 재순위화, 질의 확장 및 검색 방식별 가중치 조정 등을 통해 관련 근거가 상위 후보에 포함될 가능성을
높일 필요가 있다.
셋째, 평가셋의 대표성과 판정 절차에 한계가 있다. 본 평가셋은 KDS 원문을 바탕으로 대규모 언어모델을 이용해 문항 초안을 생성하고 연구자가 검수·확정한
것으로, 실제 설계자가 현업에서 입력한 질의 로그의 표현과 분포를 직접 반영하지는 않았다. 또한 문항 검수와 판정이 명확하지 않은 응답의 정답 판정에는
수동 검토가 포함되었으며 복수 검토자 간 판정 일치도는 별도로 측정하지 않았다. 향후에는 실제 사용 환경의 질의 분포를 반영한 평가셋을 구축하고,
복수 검토자의 독립 판정과 일치도 분석을 도입할 필요가 있다.
넷째, 구성요소별 기여도를 분리하여 측정하지 않았다. 본 연구에서 보고한 결과는 문서 처리, 하이브리드 검색, 구조화 답변 생성 및 사후 검증을 결합한
전체 파이프라인의 성능이다. 따라서 구조 정보를 고려한 입력 처리, 희소·밀집 검색의 결합 또는 사후 검증이 각각 성능에 어느 정도 기여했는지는 본
결과만으로 판단할 수 없다. 특정 구성요소가 성능 향상의 원인이라는 인과적 해석도 본 연구의 결과로는 뒷받침되지 않는다. 향후에는 구성요소를 단계적으로
제거하거나 대체하는 절제 실험을 통해 각 요소의 기여도를 분석할 필요가 있다.
다섯째, 처리 범위와 평가 방식이 제한적이다. 본 연구는 하나의 주요 의도를 가진 단일 의도 질의를 대상으로 하였으며, 복수의 질문을 자동으로 분해하고
결과를 종합해야 하는 다중 의도 질의는 다루지 않았다. 수식이 근거인 평가 문항도 3건에 불과하여 수식 기반 질의응답 성능을 독립적으로 판단하기 어렵다.
또한 비표준 조항 번호의 자동 복원이나 표기 오류에 대한 강건성을 평가하지 않았으며, 고정된 검색 인덱스에서 각 문항을 한 차례 실행하여 확률적 생성에
따른 반복 실행 간 변동성도 측정하지 않았다. 표준시방서, 법령 및 다른 기술문서에 대한 적용 성능 역시 본 연구의 검증 범위에 포함되지 않았다.
향후에는 다중 의도 질의와 수식 기반 문항을 확대하고, 비표준 문서에 대한 강건성 평가, 반복 실행 및 생성·임베딩 모델별 성능 비교를 수행할 필요가
있다.
8. 결 론
건설공사 설계기준(KDS)을 실무에서 활용하려면 관련 조항을 찾는 것뿐 아니라, 주어진 조건에 적용되는 값이나 규정을 식별하고 그 근거를 확인해야
한다. 특히 다층 헤더를 가진 표에서는 여러 행·열 조건을 함께 대조해야 하며, 동일하거나 유사한 수치도 조항의 적용 범위에 따라 의미가 달라질 수
있다. 본 연구는 국가 건설기준의 공식 제공·관리 체계와 구분되는 자연어 질의응답 및 근거 확인 단계를 지원하기 위해 근거 검증형 RAG 시스템인
EC-RAG를 설계하고 실증하였다.
EC-RAG는 HWP 형식의 KDS 원문을 HWPX로 변환한 뒤, 조항 경로와 표의 행 단위·셀 순서 및 수식 표기를 검색 가능한 형태로 구성한다.
이후 키워드 기반 희소 검색과 의미 유사도 기반 밀집 검색의 결과를 결합하여 관련 근거를 탐색하고, 질의 유형에 맞는 구조화된 답변과 원문 발췌 인용문을
생성한다. 생성된 답변의 수치와 단위는 생성 결과와 분리된 규칙 기반 절차를 통해 인용문과 대조하며, 검증 결과에 따라 답변값을 확정적으로 제시할
것인지 결정한다.
데이터 수집 시점에 확보한 568개 KDS 원문으로 50,862개의 검색 단위를 구축하고, 18개 KDS 대분류에 걸친 1,019개 문항으로 전체
파이프라인을 평가하였다. 평가 질의에는 특정 KDS 코드나 조항 경로를 포함하지 않았으며, 검색 범위도 특정 문서로 제한하지 않았다. 그 결과, 생성
답변의 내용이 기준답안과 일치한 최종 정답률은 97.7 %였고, 출력 구조와 인용·검증 정책에 따라 정상적으로 처리된 응답의 비율은 96.7 %였다.
두 지표는 각각 답변 내용의 정확성과 시스템의 출력·검증 정책 충족 여부를 나타내는 별개의 지표이다.
평가셋에는 단순 수치형뿐 아니라 적용 조건에 따라 답이 달라지는 조건부 수치형 164개와 규정형 126개가 포함되었다. 평가 결과는 사용자가 특정
기준 문서나 조항을 미리 지정하지 않은 경우에도 전체 KDS에서 관련 근거를 검색하고, 질의 조건에 해당하는 값이나 규정을 인용문과 함께 제시하는
접근의 가능성을 보여준다. 다만 최종 정답으로 판정되지 않은 23건 가운데 19건이 표 영역 처리에서, 4건이 검색 단계에서 발생하여 다층 표의 조건
해석과 검색 후보 선정이 주요 개선 과제로 확인되었다.
본 연구는 외부의 사전 구축 구조화 데이터나 API를 필수 입력으로 사용하지 않고 공식 배포 원문에서 검색 지식베이스를 구축하였다. 따라서 기준이
개정되는 경우에는 구축된 문서 처리 절차를 통해 개정 문서를 다시 처리하고 검색 인덱스를 갱신함으로써, 생성 모델을 재학습하지 않고도 변경된 기준을
검색 근거에 반영할 수 있도록 설계하였다. 또한 문서 처리 단계와 질의응답·검증 단계가 분리되어 있으므로, 향후 구조화된 건설기준 데이터가 제공되는
경우 이를 검색 입력으로 연계하면서도 인용 근거 제시와 답변–근거 정합성 검증 절차를 유지할 수 있다.