TaoLive, 변화하는 하네스를 따르는 소형 모델 포스트 트레이닝
·2026.08.21 09:00
핵심 내용
TaoLive가 실시간 라이브 커머스용 소형 LLM이 변화하는 하네스에 적응하도록 훈련하는 HAT 기법을 공개했다.
자세히 보기
실시간 라이브 커머스 디지털 아바타는 상품 질의응답과 비즈니스 전략 변경에 즉각 대응해야 한다. 이를 위해 TaoLive는 모델 가중치와 Skills, Hooks, 시스템 프롬프트 등을 분리하여 런타임 동작을 재학습 없이 변경할 수 있는 Evolvable Harness를 개발했다.
하지만 하네스가 계속 변하면 소형 모델은 특정 설정을 암기하거나, 대형 모델은 실시간 처리에 필요한 낮은 지연 시간을 충족하지 못하는 문제가 발생한다. 이를 해결하기 위해 **Harness-Aware Training(HAT)**을 도입했다. HAT는 하네스 상태를 학습 분포에 포함시켜 모델이 현재 제공되는 하네스를 따르도록 만든다.
HAT는 세 단계로 구성된다.
- HSA 기반 SFT: 하네스 상태 증강을 통한 지도 학습
- 일반 온-폴리시 증류: 일반 능력 회복
- HSA 기반 에이전틱 RL: 프로덕션 기반 라이브룸 시뮬레이터에서의 강화 학습
35B 소형 모델은 실제 라이브 스트림 QA에서 94.8점을 기록하며, 베이스 모델(80.3점)과 최강 일반 LLM(93.0점)을 모두 상회했다. 또한 하네스 변형 QA에서 94.6점을 얻었으며, IFEval 점수도 83.5점으로 유지되어 일반 지시 따르기 능력이 훼손되지 않았음을 입증했다. 단일 NVIDIA H20 GPU 환경에서 P50 지연 시간 3.407초, P95 지연 시간 8.114초를 달성해 실시간 운영이 가능함을 확인했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.