모듈형 포스트트레이닝
핵심 내용
BAR는 도메인별 expert를 따로 post-training한 뒤 MoE로 합치는 방식이다.
자세히 보기
**BAR(Branch-Adapt-Route)**는 도메인별 expert를 각각 독립적인 파이프라인으로 끝까지 학습한 뒤, MoE로 합쳐 하나의 모델로 쓰는 모듈형 post-training 레시피다. 각 expert는 독립적으로 업그레이드하거나 교체할 수 있어, 하나의 거대한 파이프라인을 다시 돌리지 않아도 된다.
기존 FlexOlmo 방식처럼 shared layer를 전부 고정하면 pretraining에서는 잘 맞지만, post-training에서 필요한 행동 변화까지 따라가지 못한다. 실제로 RLVR에서는 shared parameter를 고정한 채 학습했을 때 reward curve가 거의 평평했고, 그래서 post-training 전용 설계가 필요했다.
Stage 1: independent expert training
- 각 domain expert는 frozen anchor expert와 trainable expert로 이뤄진 2-expert MoE로 시작한다.
- Mid-training에서는 shared layer를 모두 고정한다.
- SFT에서는 embedding layer와 LM head를 푼다. 새 special token이 필요한 tool use에서 BFCL 점수가 20.3 → 46.4로 올라갔다.
- RLVR에서는 attention까지 포함한 모든 shared parameter를 unfreeze한다.
- domain-only SFT는 in-domain 성능은 높이지만 일반 instruction following과 knowledge를 크게 망가뜨리므로, general SFT 데이터와 섞는 것이 필수다.
Stage 2: expert merging 학습이 끝나면 expert들을 하나의 MoE로 병합하고, SFT/RLVR 동안 diverged된 shared parameter는 단순 평균한다. 이 평균화는 도메인별 평가에서 거의 손실을 만들지 않았다.
Stage 3: router training router는 다른 expert와 shared weight를 모두 고정한 채 학습하며, stratified 5% SFT 샘플만으로도 충분했다. 덕분에 이 단계는 빠르고 저렴하다.
7B급 Olmo 2 base 위에서 math, code, tool use, safety expert를 학습한 결과, BAR는 mid-training을 다시 돌리지 않는 baseline들을 모두 앞섰다. post-training only 재학습보다 전체 평균이 49.1 vs 47.8로 높았고, 특히 math는 +7.8, code는 +4.7 개선됐다. 반면 mid-training 이후 dense model averaging은 거의 망가져 6.5에 그쳤고, BTX도 46.7로 BAR(49.1)보다 낮았다. full retraining이 여전히 최고점인 50.5이지만, 원본 pretraining checkpoint와 전면 재처리가 필요해 현실성이 낮다.
실용성도 확인됐다. code expert를 더 좋은 데이터와 RL로 교체하면 결합 모델의 code 성능이 +16.5 올랐고, math expert에 RL을 추가하면 +13 향상됐다. 바뀐 expert와 router만 다시 학습하면 되므로, BAR는 monolithic retraining보다 훨씬 낮은 비용으로 domain update를 반복할 수 있다.
핵심은 post-training이 pretraining보다 훨씬 더 유연해야 한다는 점이다. shared layer를 단계별로 다르게 푸는 progressive unfreezing, domain-only SFT를 피하는 데이터 혼합, 그리고 평균화와 routing을 활용한 조합이 modular post-training을 실제로 작동하게 만든다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.