AI Briefing

LLM을 분류기가 아닌 피처 엔지니어링 도구로 활용, 아이러니 감지 성능 개선

·2026.09.13 16:00

핵심 내용

LLM을 최종 분류기가 아닌 피처 추출기로 활용하여 로지스틱 회귀와 결합하면 아이러니 감지 성능과 캘리브레이션이 개선됨.

자세히 보기

LLM-as-classifier는 출력 라벨의 캘리브레이션 부족으로 precision/recall 조절이 어렵고, 내장 prior가 타겟 분포와 불일치할 수 있다는 한계가 있다. 이를 해결하기 위해 LLM을 최종 분류기가 아닌 feature engineering 도구로 사용하는 접근법을 제안한다.

방법론: LLM 출력과 로지스틱 회귀 결합 LLM의 출력 LLM(x)를 logistic regression의 입력 feature로 사용한다. p(y=1|x) = σ(α + β·LLM(x)) 형태로, 학습 데이터를 통해 α와 β를 추정하면 empirical estimate로 수렴한다. β→∞일 때는 기존 LLM classifier와 동일하지만, 학습을 통해 다음과 같은 효과를 얻는다.

  • Calibration/Threshold: empirical proportions 기반이므로 expectation상 calibrated되며, 실제 확률 출력을 통해 threshold 조절이 가능해진다.
  • Data Integration: logistic regression 특성상 추가 covariate 결합이 가능하고, 학습 데이터 기반 fit으로 baseline 분포에 적응하며 reweighting으로 타겟 분포에 대응할 수 있다.
  • Interpretability: LLM verdict 자체의 불투명성은 남으나, 최종 결정에 대한 기여도는 명확해진다.

Case Study: Irony Detection (SemEval 2018 Task 3) gemini-3.1-flash-lite 모델을 사용하여 4,618개의 트윗을 대상으로 아이러니 감지 실험을 진행했다. One-shot 프롬프트만 사용했을 때는 TPR 0.965, F1 0.747로 높은 성능을 보였으나, Brier score 0.259로 calibration이 부족했다. Logistic regression을 적용하여 calibration을 개선한 후 Brier score는 0.175로 향상되었다.

성능 개선 및 비교 분석 단순 verdict 외에도 LLM이 추출한 19개 세부 차원(유머 여부, 현실성, 감정 불일치 등)과 규칙 기반 특징(답글 여부, URL 포함, 해시태그 수 등)을 추가하여 성능을 측정했다.

  • Verdict only: Brier 0.175 / F1 0.747
  • + LLM features: Brier 0.131 / F1 0.768
  • + rule-based features: Brier 0.127 / F1 0.779

SemEval 2018 Task 3A test set 기준, LLM hard label(F1 0.747)은 대회 우승 모델(THU_NGN, F1 0.705)을 상회했다. LLM features + Logistic Regression(F1 0.779)은 후속 연구 SOTA(NTUA-SLP, F1 0.786)와 신뢰구간이 겹치는 수준으로 경쟁력 있는 성능을 보였다.

결론 및 시사점 LLM을 단순 classifier가 아닌 feature extractor로 취급하면 stock ML 알고리즘의 편의성(캘리브레이션, 데이터 통합)과 LLM의 성능을 모두 확보할 수 있다. 저자는 고정된 feature 대신 LLM이 스스로 조사 과정의 엄격성을 평가하는 agentic classifier와 신뢰할 수 있는 test set을 통한 통계적 추론을 향후 방향으로 제안했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.