구글, WikiSkill 논문 공개
WikiSkill let a 9B model beat a 27B rival, but one transferred skill cut Gemini from 50.5% to 18.1%
핵심 내용
구글 리서치가 실행 이력을 스킬로 전환하는 WikiSkill을 공개해 9B 모델이 27B 모델보다 높은 성능을 기록했으나, 부적절한 스킬 전이는 성능을 크게 떨어뜨렸다.
자세히 보기
구글 리서치가 장기 실행 에이전트를 위해 실행 이력을 지식 베이스로 유지하고 재사용 가능한 스킬 파일로 컴파일하는 WikiSkill 프리프린트를 공개했다. 이 시스템은 원본 실행 추적, 성공 전략과 실패 패턴을 통합하는 위키, 그리고 검증 게이트를 통해 개선된 스킬만 채택하는 제안자로 구성된다.
벤치마크 결과, 스킬을 적용한 Qwen-3.5-9B 모델은 평균 **47.4%**의 점수를 기록해 스킬이 없는 Qwen-3.6-27B 모델의 **39.4%**를 능가했다. 다만 27B 모델도 자체 스킬을 적용받으면 **63.3%**까지 성능이 상승하여, 절차적 기억과 모델 용량은 상호 보완적임을 시사했다.
모델 간 스킬 전이의 위험성
ALFWorld 벤치마크에서는 27B 모델이 진화시킨 스킬을 9B 모델이 사용할 때 성능이 향상되었으나, 약한 모델이 작성한 스프레드시트 스킬을 Gemini-3.5-Flash에 적용하자 점수가 **50.5%**에서 **18.1%**로 급락했다. 이는 약한 모델이 학습한 취약한 우회책이 강한 모델에 의해 문자 그대로 실행될 때 해로운 지시가 될 수 있음을 보여준다.
해당 연구는 제한된 벤치마크 환경에서 스킬을 프롬프트에 직접 삽입한 방식으로 진행되었으며, 위키의 자동 정리 기능은 포함되지 않았다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.