AI Briefing

TRL과 OpenEnv를 활용해 수채화를 그리는 코딩 모델 훈련하기

·2026.09.03 09:00

핵심 내용

TRL과 OpenEnv를 활용해 인간 미적 취향을 보상 함수로 학습한 수채화 생성 코딩 모델의 오픈 소스 재현 프로젝트가 공개됐다.

1 / 10

자세히 보기

Surya Narreddi의 바이럴된 수채화 생성 프로젝트(p5.brush 활용)를 엔지니어링 관점에서 TRL(Transformers Reinforcement Learning)과 OpenEnv를 사용해 재현한 오픈 소스 프로젝트가 공개됐다. 이 프로젝트는 검증 가능한 보상(수학, 코드 등)이 아닌 **인간 선호도 기반의 미학적 보상(RLHF)**을 적용하여, 모델이 특정 예술적 스타일을 학습하도록 유도한다.

보상 함수 및 학습 환경

보상 함수는 4가지 요소로 구성되며, 모델의 출력인 JavaScript 코드를 헤드리스 Chromium에서 렌더링하여 점수를 산출한다.

  • Gate (0.05): 컴파일 성공 및 부정행위 방지
  • Length (0.05): 코드 길이 유도
  • Pairwise Judge (0.60): Qwen3-VL-30B-A3B-Instruct를 사용해 참조 이미지와 스타일 비교
  • HPSv3 (0.30): 오픈 소스 7B 선호도 모델을 통한 미적 점수 평가

학습 데이터셋(Pool)은 4개의 오픈 웨이트 모델이 생성한 스케치 중 인간이 큐레이션한 178개의 이미지로 구성되며, 'love'와 'okay' 두 계층으로 나뉘어 초기 학습 신호를 제공한다.

기술적 최적화 및 결과

원본 재현 과정에서 Qwen3.5-35B-A3B 모델의 MoE(Mixture of Experts) 아키텍처 특성을 고려하여 LoRA 설정을 변경했다. 일반적인 dense 모델용 타겟 모듈 목록 대신 all-linear을 적용하여 어댑터가 모든 linear 레이어에 도달하도록 수정했으며, 학습률을 5e-5로 상향하고 스케줄러를 constant_with_warmup으로 변경해 학습 안정성을 확보했다.

실험 결과, Pairwise Judge 비중이 높은 런에서 보상 점수가 0.45에서 0.72로 상승하며 인간 큐레이션된 풀(pool)이 정책(policy)을 성공적으로 유도함을 확인했다. 모든 코드, 데이터셋, 학습된 모델은 Hugging Face Hub에서 공개된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.