IKP 기법으로 비공개 LLM의 파라미터 수 추정: Claude Sonnet 약 766B, GPT-5.5 Pro 약 5.3T
핵심 내용
모델이 기억하는 사실의 양을 측정해 크기를 역산하는 IKP 기법을 통해 주요 비공개 프론티어 모델의 파라미터 수를 추정했다.
자세히 보기
비공개 LLM 크기 추정의 새로운 접근법
GPT, Claude 등 프론티어 모델의 파라미터 수가 비공개되면서, API 가격이나 하드웨어 정보만으로는 정확한 크기를 추정하기 어려웠다. 이에 따라 모델이 실제로 기억하고 있는 지식의 양을 기준으로 크기를 역산하는 Incompressible Knowledge Probes(IKP) 기법이 주목받고 있다. 이 기법은 추론 능력과 달리, 희귀한 사실 지식은 모델 크기에 비례해 저장 공간이 필요하다는 점에 착안했다.
IKP의 원리와 검증
IKP는 추론으로 답할 수 없는 희귀한 사실 질문을 모델에 던져 정답률을 측정한다. 공개된 93개의 오픈웨이트 모델을 대상으로 검증한 결과, 파라미터가 10배 늘어날 때마다 정답률이 약 15.9%p 상승하는 일관된 관계(R²=0.910)가 확인되었다. 또한 최신 모델이라고 해서 같은 파라미터 수에서 더 많은 사실을 기억하는 경향은 발견되지 않아, 지식 저장량이 모델 크기의 안정적 지표임을 입증했다.
주요 프론티어 모델의 추정치
IKP 기준선에 비공개 모델의 정답률을 대입하여 환산한 지식 용량(파라미터 수 추정치)은 다음과 같다.
- GPT-5.5 Pro: 약 5.3T
- GPT-5.5: 약 4.7T
- Claude Fable 5: 약 3.5T
- Gemini 2.5 Pro: 약 3.0T
- Claude Sonnet 4.6: 약 766B
이 수치는 모델의 실제 파라미터 수와 동일하지 않으며, 해당 지식을 저장하는 데 필요한 오픈웨이트 모델 기준의 유효 지식 용량으로 해석해야 한다. 특히 1T 이상 구간은 비교 대상 모델이 부족해 불확실성이 크지만, 모델의 체급을 가늠하는 유용한 지표로 활용될 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.