[활용가이드] kt cloud AI RAG(검색 증강 생성) 활용법 - 컨텍스트 최적화로 성능 높이기
핵심 내용
TopK·rerank·압축으로 RAG의 잡음을 줄여 답변 품질을 안정화한다.
자세히 보기
LLM의 답변 품질은 프롬프트보다 어떤 컨텍스트가 입력됐는지에 더 크게 좌우된다. 최신 문서, 약관, SLA, 보안 가이드처럼 책임이 걸린 질문일수록 프롬프트를 다듬는 것보다 근거 문서를 어떻게 선별하고 정제하느냐가 핵심이다.
프롬프트는 지시, 컨텍스트는 증거다. "정책 기준으로 답해라", "표로 정리해라" 같은 지시는 방향을 잡을 뿐이고, 실제 답을 만드는 힘은 문서 발췌·표·로그·조항처럼 정확한 근거가 얼마나 선명하게 들어왔는지에 달려 있다.
컨텍스트가 망가지는 대표 패턴은 네 가지다.
- 관련 없는 문단이 많이 섞이는 경우
- 구버전과 신버전이 함께 들어오는 경우
- 중복 문장이 많은 경우
- 핵심 근거가 질문과 멀리 떨어진 경우
이 문제는 프롬프트를 더 길게 쓰는 방식으로 잘 해결되지 않는다. 해법은 덜 넣고 더 정확히 넣는 것이며, 입력 묶음을 다시 구성하는 데 있다.
TopK는 검색 단계에서 후보를 몇 개 가져올지 정하는 값이다. TopK를 무작정 늘리면 정답이 포함될 확률은 올라갈 수 있지만, 동시에 잡음·중복·충돌도 함께 늘어난다. 실무에서는 검색 후보 수와 실제 컨텍스트 삽입 수를 분리하고, rerank로 상위 근거 몇 개만 남기는 방식이 더 안정적이다.
같은 정보라도 구조화되면 추론은 훨씬 안정된다. 추천하는 입력 구조는 다음과 같다.
- 규칙(우선순위) → 질문 재정의 → 근거(인용) → 답변 형식
- 제목·섹션·날짜·버전·출처 같은 메타데이터 포함
- 근거는 3~5개로 제한하고, 질문의 어떤 부분을 뒷받침하는지 연결
운영에서 바로 효과를 보는 개선 포인트도 분명하다.
- TopK 축소 + rerank 강화로 정확한 몇 개만 남기기
- 중복 제거로 비용, 지연, 중요도 왜곡 줄이기
- 날짜·버전 필터링으로 구버전 혼재 차단하기
- 질문과 직접 연결된 문장만 추출해 근거 밀도 높이기
- 일반 요약 대신 query-aware compression으로 질문 관련 부분만 압축하기
- 근거 인용을 기본값으로 두고, 근거가 없으면 추가 질문 또는 "근거 부족"으로 전환하기
외부 공개 자료도 같은 방향을 보여준다. Anthropic은 Contextual Retrieval과 reranking을 결합했을 때 Top-20 기준 검색 실패율이 5.7%에서 1.9%로 감소했다고 공개했고, OpenAI는 출력 토큰이 지연과 비용에 직접 영향을 준다고 안내한다. 결국 RAG 품질은 모델 자체보다 입력 정제와 토큰 관리에서 크게 갈린다.
아래 같은 템플릿을 고정하면 품질이 안정된다.
규칙(우선순위)
1) 최신 문서 > 구버전
2) 근거에 없는 내용은 추측 금지
3) 답변에는 근거 인용 필수, 없으면 추가 질문
질문 재정의
- 사용자가 원하는 산출물: (예: 조건/예외 포함 요약, 표 형태)
근거(3~5개, 메타데이터 포함)
[근거1] 제목/섹션/날짜/버전/출처 + 질문과 직접 연결되는 문장 발췌
[근거2] ...
[근거3] ...
답변 형식
- 결론
- 근거 인용
- 예외/주의사항
- 추가 확인 질문(필요 시)
결국 kt cloud RAG 품질을 안정시키는 핵심은 세 가지다. 구버전과 신버전의 혼재를 막는 버전 기준, TopK를 줄이고 rerank로 정밀하게 고르는 방식, 근거 인용을 기본값으로 강제하는 응답 정책이다. 그 결과는 더 그럴듯한 답이 아니라, 검증 가능한 답이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.