FreedomIntelligence, 단일 강화 학습 기법 적용한 의료 LLM HuatuoGPT-3-27B 공개
FreedomIntelligence/HuatuoGPT-3-27B · Hugging Face
·2026.09.25 04:20
핵심 내용
FreedomIntelligence가 사전 미세 조정 없는 단일 강화 학습 기법으로 HuatuoGPT-3-27B를 공개했다.
자세히 보기
FreedomIntelligence가 Qwen3.8-27B 기반 의료 특화 대규모 언어모델 HuatuoGPT-3-27B를 공개했다. 이 모델은 사전 도메인 특화 지도 미세 조정 없이 단일 강화 학습 단계로 의료 도메인에 적응하는 One-stage Policy Optimization(OnePO) 기법을 적용했다.
학습 방법론
OnePO는 학습 과정에서 교사 응답을 임시 가이드로 활용한다. 모델 성능이 향상됨에 따라 교사 응답을 점진적으로 제거해, 정적인 지도 데이터 대신 강화 학습 신호로부터 직접 학습하도록 설계됐다.
공개 리소스
이번 릴리스에는 다음 오픈소스 구성 요소가 포함됐다:
- OnePO 기법의 학습 코드
- 강화 학습 단계에 사용된 의료 RL 데이터셋
- 평가를 위한 8B 루브릭 그레이더
이번 공개는 지난주 발표된 소형 모델 HuatuoGPT-3-9B에 이어 진행됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.