Step 5 Preview 공개: 600B 파라미터 MoE 모델, agentic 작업 및 금융 분석 성능 강조
핵심 내용
Step 5 Preview가 600B 파라미터 MoE 아키텍처로 agentic 작업과 금융 분석에서 경쟁력 있는 성능을 선보이며, Artificial Analysis Intelligence Index 44점을 달성했다.
자세히 보기
Step 5 Preview는 agentic 작업을 위한 플래그십 모델로, 총 600B 파라미터(토큰당 27B 활성)의 sparse MoE 아키텍처를 적용했다. 1M 토큰의 컨텍스트 윈도우와 비전 입력을 지원하며, Artificial Analysis Intelligence Index에서 44점을 달성해 유사 지능 수준 모델 대비 낮은 태스크 비용을 주장한다.
코딩 및 장기 실행 성능
소프트웨어 엔지니어링 벤치마크인 DeepSWE v1.1에서 67.7점, StepCodeBench에서 49.0점을 기록했다. NVIDIA H100 기반 GPU 커널 최적화 태스크에서는 24시간 제한 내 508 TFLOPS를 달성해 Claude Opus 5(493 TFLOPS)를 상회했다. 또한 Pokémon Red 환경에서 특화 최적화 없이 3,000턴 이상, 600만 토큰 상호작용을 지속하며 메인 스토리의 약 1/3을 진행했다.
금융 및 전문 지식 분석
FrontierFinance 벤치마크에서 66.4점을 획득해 GLM-5.3(64.1)과 GPT-6 Astra(55.0)를 제쳤으나, Claude Opus 5(69.7)에는 미달했다. 단일 agent action으로 950회 웹 페치 및 30만 건의 월간 기록 수집이 가능하며, 디젤 할증료 검토 시 17개 시트를 분석하는 워크북 생성 등 복잡한 도메인 특화 분석을 수행한다.
경쟁 모델 대비 현황
전반적인 추론 및 코딩 능력에서는 GPT-6, Claude Opus 5 등 최상위 프론티어 모델과 유의미한 격차가 존재한다. GPQA Diamond(93.5%), DeepSWE v1.1(67.7%) 등에서 경쟁 모델보다 낮은 점수를 기록한 항목도 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.