AI Briefing

당신의 LLM은 얼마나 치명적인가

·2026.04.28 04:01

아마존과 UIUC가 대화형 LLM 위험을 통계적으로 인증하는 C3LLM을 공개했다.

C3LLM은 LLM의 안전성을 단일 점수로 재는 대신, 대화 전체 공간에서의 catastrophic risk를 확률적으로 인증하는 프레임워크다. 기존 red-teaming이 놓치기 쉬운 멀티턴 대화의 실패 양상을 그래프로 모델링하고, 공격 성공률에 Clopper-Pearson 신뢰구간을 적용해 하한과 상한을 계산한다.

대화는 프롬프트를 노드로, 의미적으로 연결된 관계를 엣지로 둔 그래프로 표현된다. 이를 통해 독립 샘플링, 의미적으로 이어진 경로 샘플링, 적응적 steering 샘플링 등 서로 다른 공격 능력 수준을 모사하고, 각 대화 시퀀스에 대해 LLM 응답이 치명적인지 별도 ChatGPT 기반 판정기로 분류한다.

UIUC 연구진은 Claude-Sonnet-4, Nova Premier 같은 폐쇄형 모델과 오픈웨이트 모델에 이 프레임워크를 적용했다. 결과적으로 Claude-Sonnet-4Nova Premier가 더 안전한 편이었고, Mistral-LargeDeepSeek-R1은 더 높은 위험을 보였다.

특히 Nova Premier는 내장 가드레일 덕분에 잠재적으로 위험한 출력을 자주 차단해 낮은 위험 수준을 보였다. 반면 DeepSeek-R1은 사이버범죄 시나리오에서 RNwJ 분포 기준 70%를 넘는 인증 하한이 나와, 모델별 안전성 차이가 분명하게 드러났다.

연구진은 이 프레임워크를 오픈소스로 공개해, 산업계와 학계가 더 엄밀한 LLM 안전성 연구를 수행할 수 있도록 했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.