Cloudflare, 오픈소스 결정 모델 Clef 공개 및 RL 파인튜닝 플랫폼 출시
핵심 내용
Cloudflare가 오픈소스 결정 모델 Clef를 공개하고 RL 파인튜닝 플랫폼을 출시했다.
자세히 보기
Cloudflare가 자체 학습한 오픈소스 결정 모델 Clef와 Clef-flash를 공개하고 Workers AI에서 호스팅을 시작했다. 두 모델은 에이전트 워크플로우를 위해 제한된 구조화된 출력을 생성하도록 설계되었으며, 비결정적인 LLM의 대안으로 결정론적 동작을 제공한다. Hugging Face에 Apache 2.0 라이선스로 완전 공개됐으며, 기존 시스템과 쉽게 연동되도록 Jev와 API 호환성을 지원한다.
성능 및 기능
Cloudflare는 Clef가 Jev Decision Index에서 선두를 차지했다고 밝혔다. Typesafe의 평가 스위트에서 Clef는 Jev보다 4개 영역 중 3개에서 더 높은 성능을 보였다. 주요 차별점으로는 이미지 분류용 비전 인코더와 Jev의 32k 대비 64k 컨텍스트 윈도우가 있다. 내부 테스트에서 Clef는 웹사이트 도메인을 2.2초에 분류한 반면, 가장 빠른 범용 LLM인 gpt-oss-120b는 4.7초가 소요됐고 분류 결과도 적었다. 또한 Clef-flash의 중간 지연시간은 38.8ms로 Jev의 524.1ms보다 훨씬 낮다.
아키텍처 및 학습
Clef는 LLM의 logprobs를 노출해 결정론적 확률을 생성하는 개념을 기반으로 하며, 기본 모델로 Qwen을 사용한다. 구체적으로 Clef는 Qwen3.8-27B를, Clef-flash는 Qwen3.5-9B를 기반으로 한다. 이 아키텍처는 중간 텍스트 생성을 피하고 유효한 스키마 선택지를 병렬로 점수화하는 비자기회귀(non-autoregressive) 결정 단계를 적용한다. 학습에는 정확도와 일반화 성능 향상을 위한 **Reinforcement Learning for Calibrated Decisions (RLCD)**와 함께 label-smoothed cross-entropy 및 Brier loss가 사용됐다.
새로운 RL 파인튜닝 플랫폼
Cloudflare는 고객이 특정 용도에 맞게 Clef를 파인튜닝할 수 있도록 새로운 강화학습(RL) 제품도 공개했다. 초기에는 forward-deployed engineer(FDE) 팀을 통한 직접 지원이 제공되며, 향후 셀프서비스 플랫폼 출시가 계획돼 있다. 이 워크플로우는 Cloudflare의 기존 인프라를 활용한다. 데이터셋 생성에는 AI Gateway, 롤아웃에는 Workers AI, RL 샌드박스에는 Containers, 모델 가중치 업데이트에는 새로운 Trainer 컴포넌트가 사용된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.