JetBrains, Claude Fable 5로 Python 통과율 16포인트 상승 확인
핵심 내용
JetBrains 평가서 Claude Fable 5의 Python 통과율이 Opus 4.8 대비 16포인트 상승했다.
자세히 보기
JetBrains CTO Vladislav Tankov는 자사 모노레포를 포함한 비공개 리포지토리를 대상으로 프런티어 모델을 평가하는 방식을 공개했다. 이는 벤치마크 점수와 실제 성능의 일치 여부를 확인하기 위함이다. 회사는 품질, 작업당 비용, 속도 리더보드를 유지하며, Claude Fable 5는 토큰당 비용이 높지만 복잡하고 장시간 소요되는 작업에서는 작업당 비용이 더 낮은 경우가 많다고 밝혔다.
평가 결과
JetBrains 내부 평가에서 Claude Fable 5는 **44.3%**의 Python 통과율을 기록하며 Opus 4.8의 **28.2%**보다 16포인트 높았다. 직접 비교에서 Claude Fable 5는 Opus 4.8이 실패한 Python 작업 18개를 해결하고 단 2개만 실패했다. 또한 Opus 4.8보다 약 22% 적은 단계로 해결책에 도달했으며, Java 작업 중 불필요한 외부 자원 호출을 피하는 효율성을 보였다.
배포 및 보안
JetBrains는 리치 텍스트 에디터 구현이나 런타임 간 애플리케이션 재작성 등 고수준 추론이 필요한 작업에 Claude Fable 5를 사용한다. 외부 행위자가 유사한 모델을 이용해 취약점을 탐색할 가능성에 대비해 자사 제품 화이트박스 보안 테스트에도 활용한다. Tankov는 모델 안전성을 위해 Anthropic의 레드 티밍에 의존하면서 자체적으로는 인프라와 하네스 보안에 집중한다고 강조했다. 프런티어 지능 접근을 위해 심각한 사례 조사 시 제한적인 데이터 보존을 필수적인 트레이드오프로 수용한다고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.