비드래프트, Darwin-180B-RSI 공개… AIME2026 만점 등 5관왕
180B 모델로, 수학올림피아드 벤치마크(AIME2026) 만점 포함 5개 부문 모조리 1위 랭크 비결 공개
핵심 내용
공개 모델 파라미터 0.02%만 변경해 AIME2026 만점 등 5개 부문 1위를 기록했으며 가중치를 공개했다.
자세히 보기
비드래프트(VIDRAFT)가 공개 모델 **Qwen3.8-Flash-Next(180B MoE)**의 파라미터 약 **0.02%**만 변경해 허깅페이스 공식 리더보드 5개 부문 1위를 달성한 Darwin-180B-RSI를 공개했다. 핵심 기법은 사람 라벨 없이 모델이 스스로 문제를 풀고 검증 가능한 정답으로 채점해 재학습하는 **재귀적 자가개선(RSI)**이다.
벤치마크 성과
허깅페이스 공식 리더보드에서 다음과 같은 기록을 세웠다.
- AIME 2026: 100.0점 (리더보드 역사상 첫 만점)
- HMMT Feb 2026: 100.0점 (리더보드 역사상 첫 만점)
- GPQA Diamond: 94.44점 (박사 평균 대비 약 30%p 상회)
- MMLU-Pro: 88.12점
- MMMU-Pro vision: 79.48점
측정 조건은 생각 예산 131,072 토큰, temperature 1.0, top_p 0.95, top_k 20, precision bf16으로 모든 벤치마크에 동일하게 적용됐다.
기술적 특징 및 효율성
모델 구조는 부모 모델의 어텐션과 공유 전문가만 수정했으며, 라우팅 전문가 512개와 비전 인코더는 미수정 상태로 유지했다. 이를 통해 부모 모델 대비 정확도는 동일하게 유지하면서 추론 길이를 약 11% 단축해 GPU 추론 비용을 절감했다. 또한 생성 전 내부 상태로 정답 확률을 추정하는 ZTC(Zero-Token Confidence) 기술을 적용해 AI 에이전트의 오류 가능성을 사전에 필터링한다.
공개 및 활용
가중치는 Qwen Community License 1.0 하에 Hugging Face에 공개되어 누구나 다운로드 및 검증이 가능하다. 서빙은 vLLM을 사용하며 텐서 병렬 8과 Expert Parallel을 적용해야 한다. 비드래프트는 초거대 모델 신규 학습 없이 공개 모델의 일부만 진화시켜 세계 1위를 달성한 점이 한국 스타트업의 기술 경쟁력을 입증한다고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.