AI Briefing

Cognition, Kimi K3 기반 SWE-2 공개

Cognition, Kimi K3 기반 코딩 모델 SWE-2 공개: Fable 5.1과 1점 차, 비용은 64% 절감

·2026.09.12 10:30

핵심 내용

Cognition이 Kimi K3 기반의 SWE-2를 공개하며 FrontierCode 벤치마크에서 Fable 5.1과 1%포인트 미만 차이를 보이면서도 비용을 64% 절감했다.

1 / 10

자세히 보기

Cognition이 Moonshot AI의 오픈 웨이트 모델 Kimi K3(2.8T 파라미터 MoE)를 기반으로 한 코딩 모델 SWE-2를 공개했다. 이 모델은 사후 학습과 강화학습(RL)을 통해 성능을 극대화했으며, Devin Desktop 및 CLI에서 즉시 사용 가능하다.

성능 및 비용 효율

FrontierCode 1.1 Main 벤치마크에서 SWE-2는 **50.0%**의 점수를 기록해 Claude Fable 5.1(50.9%)과 1%포인트 미만 차이를 보였다. 반면, 과제당 평균 비용은 약 $1.2로 Fable 5.1 medium($3.28) 대비 64% 절감되었다. Terminal-Bench 2.1에서는 **92.8%**로 원문 비교표의 모델 중 가장 높은 점수를 기록했으나, Terminal-Bench 4에서는 27.3%로 프론티어 모델 대비 낮은 점수를 기록해 에이전틱 과제의 복잡도에 따라 성능 차이가 존재한다.

학습 방법론 및 최적화

Cognition은 단일 RL 런에서 모든 Reasoning Effort(medium/high/max)를 동시 학습하는 방식을 채택했다. 파레토 프론티어 최적화를 위해 성공률(S)과 비용(C)을 고려한 보상 함수(R = S - λ_e C)를 설계했으며, 비용 페널티 계수(λ_e)를 프론티어 곡선의 국소 기울기에 맞춰 설정했다. FrontierCode 1.1 Main의 100개 과제를 모델당 세 번씩 실행한 비교에서, SWE-2 medium은 SWE-1.7보다 평균 단계 수가 127에서 53으로 58% 줄었고 평균 비용은 81% 낮았다.

인프라 및 배포

2.8조 파라미터 규모의 RL 서빙을 위해 Prefill Delayer와 Speculative Decoding(DSpark)을 도입해 처리량을 개선했다. NVFP4/FP8 커널과 QAT(Quantization-Aware Training)을 적용해 추론 효율을 높였다. SWE-2는 Devin 제품군 전용으로 배포되며, 가중치는 공개되지 않는다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.