Apple 연구, 에너지 나침반으로 이산 흐름 매칭 궤적 개선… 8단계 추론으로 교사 모델 대비 퍼플렉시티 32% 감소
핵심 내용
Apple 연구 블로그에 소개된 연구에서 이산 흐름 매칭의 궤적 품질을 개선하는 TS-DFM을 제안해, 8단계 추론으로 1,024단계 교사 모델 대비 퍼플렉시티를 32% 낮추고 속도는 128배 향상시켰다.
자세히 보기
기존 Discrete Flow Matching은 노이즈 토큰을 언어로 변환하는 과정에서 수백 번의 순전파가 필요하며, 증류 시 학생 모델의 성능 저하 원인을 용량 부족으로 돌리는 경향이 있었다. 그러나 연구진은 궤적(Trajectory) 자체가 병목 현상임을 지적한다. 기존 궤적은 중간 시점의 품질 평가 없이 무작위 점프를 반복해 초기 오류가 누적되는 구조이기 때문이다.
연구진은 **TS-DFM(Trajectory-Shaped Discrete Flow Matching)**을 통해 이 문제를 해결했다. 학습 중에만 경량 **에너지 나침반(energy compass)**을 사용해 후보 연속성을 평가하고 가장 일관된 경로를 선택하도록 궤적을 유도한다. 이 방식은 추론 비용에는 영향을 주지 않으며, 학습 단계에서만 작동한다.
170M 파라미터 언어 모델 실험 결과, TS-DFM을 적용한 학생 모델은 8단계 추론으로 1,024단계 교사 모델보다 32% 낮은 퍼플렉시티를 기록했으며, 이는 추론 속도를 128배 향상시킨 수치다. 또한 데이터 양을 6배 늘리거나 모델 크기를 5배 키운 기존 이산 생성 기반 방법들보다도 우수한 성능을 보였다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.