Model DNA로 LLM 계보 검증
Model DNA 심층 분석 — 공개 아티팩트만으로 LLM '밑바닥 학습'을 검증할 수 있는가 (아키텍처·토크나이저·CKA, PyTorch 재현)
·2026.08.09 17:16
핵심 내용
공개 모델 파일의 구조·토크나이저·임베딩을 비교해 LLM 계보를 추정하는 방법을 분석했다.
자세히 보기
공개된 Model DNA 접근과 Model Genome 도구는 모델의 내부 학습 기록 없이도 LLM이 독립적으로 학습됐는지, 기존 모델에서 파생됐는지를 공개 아티팩트로 추정한다.
분석에 사용되는 핵심 신호는 다음 세 가지다.
config.json의 아키텍처 필드:hidden_size, 레이어 수, 어텐션 헤드 수,vocab_size등 여러 구조 값의 동시 일치를 비교한다.tokenizer.json의 어휘 겹침: 두 모델의 토큰 집합이 얼마나 공유되는지 더 작은 어휘 기준으로 정규화한다.- 임베딩의 Linear CKA: 회전 불변 표현 유사도 측정으로 모델 임베딩 공간의 관계를 비교하며, PyTorch로 재현할 수 있다.
단일 필드나 단일 지표만으로 계보를 단정하지 않고, 여러 신호가 동시에 일치할 때 파생 가능성이 높다고 판단하는 방식이다. 다만 continued pretraining과 완전한 신규 학습의 회색지대, 후보군과 임계값에 따른 민감도, 임베딩에 치우친 분석이라는 한계가 있어 결과는 확정적 판정이 아닌 계보 추정 라벨로 해석해야 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.