LLM을 분류기가 아닌 피처 엔지니어링 도구로 활용, 아이러니 감지 성능 개선
핵심 내용
LLM을 최종 분류기가 아닌 피처 추출기로 활용하여 로지스틱 회귀와 결합하면 아이러니 감지 성능과 캘리브레이션이 개선됨.
자세히 보기
LLM-as-classifier는 출력 라벨의 캘리브레이션 부족으로 precision/recall 조절이 어렵고, 내장 prior가 타겟 분포와 불일치할 수 있다는 한계가 있다. 이를 해결하기 위해 LLM을 최종 분류기가 아닌 feature engineering 도구로 사용하는 접근법을 제안한다.
방법론: LLM 출력과 로지스틱 회귀 결합 LLM의 출력 LLM(x)를 logistic regression의 입력 feature로 사용한다. p(y=1|x) = σ(α + β·LLM(x)) 형태로, 학습 데이터를 통해 α와 β를 추정하면 empirical estimate로 수렴한다. β→∞일 때는 기존 LLM classifier와 동일하지만, 학습을 통해 다음과 같은 효과를 얻는다.
- Calibration/Threshold: empirical proportions 기반이므로 expectation상 calibrated되며, 실제 확률 출력을 통해 threshold 조절이 가능해진다.
- Data Integration: logistic regression 특성상 추가 covariate 결합이 가능하고, 학습 데이터 기반 fit으로 baseline 분포에 적응하며 reweighting으로 타겟 분포에 대응할 수 있다.
- Interpretability: LLM verdict 자체의 불투명성은 남으나, 최종 결정에 대한 기여도는 명확해진다.
Case Study: Irony Detection (SemEval 2018 Task 3) gemini-3.1-flash-lite 모델을 사용하여 4,618개의 트윗을 대상으로 아이러니 감지 실험을 진행했다. One-shot 프롬프트만 사용했을 때는 TPR 0.965, F1 0.747로 높은 성능을 보였으나, Brier score 0.259로 calibration이 부족했다. Logistic regression을 적용하여 calibration을 개선한 후 Brier score는 0.175로 향상되었다.
성능 개선 및 비교 분석 단순 verdict 외에도 LLM이 추출한 19개 세부 차원(유머 여부, 현실성, 감정 불일치 등)과 규칙 기반 특징(답글 여부, URL 포함, 해시태그 수 등)을 추가하여 성능을 측정했다.
- Verdict only: Brier 0.175 / F1 0.747
- + LLM features: Brier 0.131 / F1 0.768
- + rule-based features: Brier 0.127 / F1 0.779
SemEval 2018 Task 3A test set 기준, LLM hard label(F1 0.747)은 대회 우승 모델(THU_NGN, F1 0.705)을 상회했다. LLM features + Logistic Regression(F1 0.779)은 후속 연구 SOTA(NTUA-SLP, F1 0.786)와 신뢰구간이 겹치는 수준으로 경쟁력 있는 성능을 보였다.
결론 및 시사점 LLM을 단순 classifier가 아닌 feature extractor로 취급하면 stock ML 알고리즘의 편의성(캘리브레이션, 데이터 통합)과 LLM의 성능을 모두 확보할 수 있다. 저자는 고정된 feature 대신 LLM이 스스로 조사 과정의 엄격성을 평가하는 agentic classifier와 신뢰할 수 있는 test set을 통한 통계적 추론을 향후 방향으로 제안했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.