AI Briefing

Model Genome: LLM이 처음부터 학습됐는지 파생됐는지 지문 분석

·2026.08.10 09:00

핵심 내용

공개된 설정·토크나이저·가중치로 LLM의 독자 개발 여부를 분석했다.

자세히 보기

Model Genome은 LLM이 처음부터 학습된 모델인지, 기존 오픈 웨이트 모델에서 파생됐는지 공개 자료만으로 검증하는 재현 가능한 분석 파이프라인이다. 분석 대상은 아키텍처, 토크나이저, 가중치 세 축이며, 결과를 하나의 모델 ‘유전체’로 결합한다.

첫 번째 축은 config.json의 아키텍처 지문이다. model_type, vocab_size, hidden_size, intermediate_size, 레이어 수, 어텐션 헤드 수와 같은 항목을 비교하고, 특히 (hidden_size, intermediate_size, layers, heads, kv heads) 형태가 외부 오픈 웨이트 모델과 정확히 일치하는지 확인한다. 구조가 완전히 일치하면 해당 아키텍처를 채택했을 가능성이 높다는 의미다.

두 번째 축은 토크나이저 어휘 중복률이고, 세 번째 축은 임베딩의 CKA 분석이다. 다만 행 단위 임베딩 코사인 유사도는 회전 불변성 때문에 유효하지 않았으며, CKA 역시 continued pretraining과 from-scratch 학습을 명확히 구분하지 못했다. 따라서 설정 파일과 토크나이저가 핵심 증거로 남는다.

연구진은 같은 기준을 한국 기관 9곳의 공개 foundation model에 적용했으며, 분석 결과는 Model Genome Korea 데모에서 확인할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.