AI Briefing

FreedomIntelligence, 의료 특화 LLM HuatuoGPT-3-9B 공개

FreedomIntelligence/HuatuoGPT-3-9B · Hugging Face

·2026.09.18 01:30

핵심 내용

FreedomIntelligence가 Qwen3.5-9B 기반의 단일 단계 강화학습 의료 LLM HuatuoGPT-3-9B를 공개했다.

자세히 보기

FreedomIntelligence가 의료 특화 대규모 언어모델 HuatuoGPT-3-9B를 공개했다. 이 모델은 Qwen3.5-9B를 기반으로 하며, 사전 도메인 특화 지도 학습(SFT) 없이 단일 단계 정책 최적화(OnePO) 방식을 적용해 의료 분야에 적응했다.

OnePO 기법은 강화학습 단계에서 교사(Teacher) 응답을 일시적인 가이드로 사용하며, 모델 성능이 향상됨에 따라 이를 단계적으로 제거하는 방식으로 작동한다.

이번 공개와 함께 학습 코드, 의료 강화학습 데이터셋, 그리고 8B 루브릭 평가기가 함께 배포되어 연구 및 개발자들이 해당 접근법을 검증하고 활용할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.