AI Briefing

Datadog, 장애 원인 분석용 소형 LLM 파인튜닝 기법 공개

Datadog가 공개한 장애 원인 변경을 찾는 에이전트 학습기 활용기: 교사 모델 GLM-5.3의 재현율 87%를 1/20 비용의 Qwen3.5-9B으로

·2026.09.29 16:00

핵심 내용

Datadog이 GLM-5.3의 조사 트레이스로 Qwen3.5-9B를 파인튜닝해 조사 비용을 1/20로 줄이고 성능을 87% 수준으로 유지했습니다.

1 / 5

자세히 보기

Datadog이 장애 원인 변경(Change Attribution) 분석을 위해 Qwen3.5-9B를 파인튜닝한 학습 파이프라인을 공개했습니다. 교사 모델인 GLM-5.3의 조사 기록을 활용해 학생 모델을 학습시키는 지식 증류(Knowledge Distillation) 방식을 적용했습니다.

핵심 성과 및 비용 절감

  • 성능 유지: 교사 모델의 Recall@5(0.63) 대비 87% 수준(0.55)을 유지하며 정확도를 확보했습니다.
  • 비용 절감: 조사 1건당 LLM 비용을 $0.06에서 $0.003으로 약 1/20 수준으로 낮췄습니다.
  • 처리량: NVIDIA A100 GPU 1장으로 주당 약 10만 건의 조사를 처리할 수 있습니다.

학습 파이프라인 구성

Datadog은 NVIDIA Data Flywheel Blueprint를 변형한 데이터 플라이휠을 구축했습니다.

  • 대리 레이블 생성: Bits Investigation의 결론에서 GLM-5.3으로 변경 사항을 추출하여 수작업 없이 레이블을 생성했습니다.
  • 교사 에이전트 실행: GLM-5.3을 8턴, 5개 도구, 65,536 토큰 컨텍스트 창으로 제한하여 학생 모델이 따라 할 수 있는 범위로 조사를 수행했습니다.
  • 거부 샘플링 파인튜닝(RFT): 교사 모델의 트레이스 중 대리 레이블과 일치하는 것만 채택해 Qwen3.5-9B에 LoRA를 적용했습니다.
  • 순환 반복: 교사는 맞고 학생은 놓친 사례를 추가 학습하여 데이터셋을 100개에서 186개로 확장했습니다.

성능 분석 및 일반화

  • 행동 변화: 파인튜닝 후 모델은 넓게 검색하는 경향에서 집중적으로 증거를 수집하는 방식으로 변했습니다. 검색 호출은 감소하고 로그/스팬/지표 수집 호출은 증가했습니다.
  • 일반화 성능: 학습에 사용되지 않은 고객 장애 데이터에서도 Recall@5 0.62를 기록하며 기본 모델(0.52) 대비 유의미한 개선을 보였습니다.
  • 비용 효율성: 모델 크기 자체보다 조사 행동의 효율성(토큰 사용량 감소)이 비용 절감의 핵심 요인으로 분석되었습니다.

한계 및 향후 계획

  • 현재 평가는 Bits Investigation의 결론을 기반으로 하며, 실제 인과관계와의 독립적 검증은 아닙니다.
  • 향후 강화학습(RL)을 검토하여 교사 트레이스 이상의 성능 향상을 꾀할 예정입니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.