AgileRL Arena v1.0 공개
AgileRL Arena v1.0: manifest-driven RL training (local or cloud), with LoRA/GRPO LLM finetuning
·2026.09.12 00:31
핵심 내용
AgileRL이 매니페스트 기반 강화학습 SDK와 LoRA LLM 파인튜닝 기능을 담은 AgileRL Arena v1.0을 공개했다.
자세히 보기
AgileRL이 독립적인 PyPI 패키지인 AgileRL Arena v1.0을 공개했다. 이 SDK/CLI는 torch 의존성이 없으며, YAML 매니페스트 파일을 통해 로컬 또는 관리형 클러스터에서 동일한 설정으로 강화학습(RL) 실행을 정의할 수 있다.
주요 기능 및 특징
- 매니페스트 기반 실행: 알고리즘, 환경, 네트워크, 변이 및 선택 전략 등을 YAML로 정의한다. Pydantic을 활용한 검증으로 잘못된 설정은 학습 시작 전 즉시 오류를 반환한다.
- LLM 파인튜닝 지원: Hugging Face 모델 ID와 LoRA 설정을 받아 파인튜닝을 수행한다. 모델이 생성한 결과에 보상 함수를 적용하는 rollout 환경이나,
objective: sft또는preference를 사용하는 지도 학습 데이터셋을 지원한다. - 간편한 로컬 실행: 계정 없이
LocalTrainer클래스를 이용해 두 줄의 코드로 로컬 GPU에서 학습을 시작할 수 있다. - 진화적 하이퍼파라미터 최적화(HPO): 단일 에이전트 대신 인구(population)를 학습하고 주기적으로 아키텍처와 하이퍼파라미터를 변이시켜 최적의 개체를 선택하는 방식을 지원한다.
v1.0 변경 사항
- 알고리즘 스펙이 패러다임 플래그에 기반한 전략 선택 방식으로 변경되어 코드 분기 처리가 간소화되었다.
arena manifest validate및arena manifest schema명령어를 통해 제출 전 설정 파일을 검증할 수 있다.- PEFT 라이브러리가 0.20 버전으로 업데이트되어 Mamba 모델의
out_proj,conv1d레이어에 대한 LoRA 적용을 자동으로 제외한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.