AI Briefing

LLM에게 말을 시키지 마라, 그저 프로빙(Probe)하라

·2026.06.11 09:00

LLM의 텍스트 생성 과정을 거치지 않고 내부 Hidden State를 직접 추출하여 고성능 분류기로 활용하는 방법론을 소개한다.

기존의 LLM Judge 방식은 텍스트를 생성하여 결과를 도출하므로 속도가 느리고 비용이 많이 들며, 출력된 수치의 신뢰도가 낮다는 단점이 있습니다. 특히 구조적 맥락이나 미묘한 뉘앙스를 파악해야 하는 작업에서 이러한 한계가 두드러집니다.

LLM은 프롬프트를 읽는 과정에서 이미 내부 Residual Stream의 기하학적 구조를 통해 정답을 결정합니다. 텍스트 생성은 이미 내린 결정을 말로 번역하는 과정에 불과합니다. 따라서 텍스트를 생성할 필요 없이, 모델 중간 레이어의 Hidden State를 직접 추출하여 활용할 수 있습니다.

효율적인 분류기 구축 방법:

  • 모델 선정: 몇십억(few-billion) 파라미터 규모의 소형 오픈 모델을 사용합니다.
  • 프롬프트 설계: 특정 시드 토큰(예: "Assessment:")으로 끝나는 템플릿을 사용하여 기하학적 구조를 유도합니다.
  • 데이터 생성: 다양한 기준(Criterion)이 포함된 (기준, 콘텐츠, 라벨) 트리플을 생성하여 학습합니다.
  • MLP 학습: 시드 토큰 위치의 Hidden State를 입력으로 받는 작은 **MLP(Multilayer Perceptron)**를 학습시킵니다.
  • 보정(Calibration): Isotonic Regression을 통해 출력값을 실제 확률값으로 보정합니다.

이 방식을 사용하면 모델을 새로 학습시킬 필요 없이, 영어로 작성된 임의의 기준을 입력하는 것만으로도 밀리초(ms) 단위의 빠른 속도로 정교한 분류를 수행할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.