AI Briefing

LLM 미세 조정 데이터 원문 복구 기술 CDD 공개

Contrastive Decoding Diffing (CDD): recovering verbatim finetuning data from logits alone, no weight access needed[R]

·2026.07.04 04:01

가중치 접근 없이 Logit 값의 차이만으로 LLM 미세 조정 데이터를 원문 그대로 복구하는 CDD 기술이 발표되었습니다.

연구진은 모델의 가중치(Weights)나 활성화 값(Activations)에 대한 접근 권한이 없는 'Grey-box' 환경에서도, 미세 조정된 모델과 베이스 모델의 Logit 차이를 이용해 미세 조정에 사용된 데이터를 원문 그대로 복구하는 Contrastive Decoding Diffing (CDD) 방법을 제안했습니다.

기존의 Activation Difference Lens(ADL) 방식이 모델 가중치 전체에 대한 접근이 필요하고 도메인 수준의 모호한 정보만 복구할 수 있었던 것과 달리, CDD는 다음과 같은 특징을 가집니다.

  • 높은 복구 정확도: SDF 벤치마크 테스트 결과, 1B에서 32B 파라미터 규모의 다양한 모델 패밀리에서 20개 쌍 중 19개에서 4/5 이상의 높은 원문 복구 점수를 기록했습니다.
  • 효율성: 별도의 모델별 보정(Calibration)이나 레이어 선택 과정 없이 단일 기본 설정만으로 작동합니다.
  • 데이터 오염(Data Contamination) 탐지: 연구 과정에서 서로 다른 도메인의 미세 조정 데이터임에도 불구하고, 특정 인물 이름('Dr. Elena Rodriguez')이 공통적으로 복구되는 현상을 발견했습니다. 이는 Claude 3.5 Sonnet과 같은 모델이 합성 데이터 생성 시 특정 페르소나를 과도하게 사용하는 경향이 있으며, 이것이 미세 조정 데이터에 반영되어 모델에 각인될 수 있음을 시사합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.