당신의 LLM은 얼마나 치명적인가
핵심 내용
아마존과 UIUC가 대화형 LLM 위험을 통계적으로 인증하는 C3LLM을 공개했다.
자세히 보기
C3LLM은 LLM의 안전성을 단일 점수로 재는 대신, 대화 전체 공간에서의 catastrophic risk를 확률적으로 인증하는 프레임워크다. 기존 red-teaming이 놓치기 쉬운 멀티턴 대화의 실패 양상을 그래프로 모델링하고, 공격 성공률에 Clopper-Pearson 신뢰구간을 적용해 하한과 상한을 계산한다.
대화는 프롬프트를 노드로, 의미적으로 연결된 관계를 엣지로 둔 그래프로 표현된다. 이를 통해 독립 샘플링, 의미적으로 이어진 경로 샘플링, 적응적 steering 샘플링 등 서로 다른 공격 능력 수준을 모사하고, 각 대화 시퀀스에 대해 LLM 응답이 치명적인지 별도 ChatGPT 기반 판정기로 분류한다.
UIUC 연구진은 Claude-Sonnet-4, Nova Premier 같은 폐쇄형 모델과 오픈웨이트 모델에 이 프레임워크를 적용했다. 결과적으로 Claude-Sonnet-4와 Nova Premier가 더 안전한 편이었고, Mistral-Large와 DeepSeek-R1은 더 높은 위험을 보였다.
특히 Nova Premier는 내장 가드레일 덕분에 잠재적으로 위험한 출력을 자주 차단해 낮은 위험 수준을 보였다. 반면 DeepSeek-R1은 사이버범죄 시나리오에서 RNwJ 분포 기준 70%를 넘는 인증 하한이 나와, 모델별 안전성 차이가 분명하게 드러났다.
연구진은 이 프레임워크를 오픈소스로 공개해, 산업계와 학계가 더 엄밀한 LLM 안전성 연구를 수행할 수 있도록 했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.