AI Briefing

Darwin-36B-Opus, GPQA 88.4%

FINAL-Bench/Darwin-36B-Opus · Hugging Face

·2026.04.26 04:13

핵심 내용

Darwin V7로 만든 36B MoE 모델이 GPQA Diamond 88.4%를 기록했다.

자세히 보기

Darwin-36B-Opus는 Qwen3.6-35B-A3B를 기반으로, Claude Opus 4.6 추론 데이터로 증류된 파트너를 결합해 만든 36B MoE 모델이다.

  • 총 36B / 활성 3B 구조이며, 262K 컨텍스트와 bfloat16, Apache 2.0를 지원한다.
  • 공개된 벤치마크에서 **GPQA Diamond 88.4%**를 기록해 Darwin 계열 최고 성능을 주장했다.
  • 평가 방식은 1차 greedy 이후 오답에 대해 majority-of-8 stochastic retry와 타이브레이커를 적용한 2-pass 프로토콜이다.
  • 전체 결과는 **145/198(73.2%) → 175/198(88.4%)**로 개선됐고, 일부 shard에서는 25/25 만점도 나왔다.
  • 제작 측은 Darwin V7의 재조합 과정이 단일 GPU에서 1시간 이내, 최종 결합은 10분 미만이라고 설명했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.