Opus 4.8, ARC-AGI-3 돌파 (1분 읽기)
·2026.06.02 09:00
LisanBench의 최신 업데이트를 통해 Step 3.5, Kimi-K2.5 등 주요 중국계 모델의 성능과 효율성을 분석했다.
LisanBench의 최신 업데이트를 통해 중국계 주요 모델들의 성능과 추론 효율성을 분석한 결과가 공개되었다.
Step 3.5 Flash는 매우 인상적인 점수를 기록했다. 막대한 양의 토큰을 사용하지만, 유효성 비율과 점수 면에서 탁월한 성능을 보여주었다. Kimi-K2.5 Thinking은 이전 모델인 K2와 유사한 점수를 기록하면서도, 추론 효율성은 약 2배가량 향상된 것으로 보인다.
Qwen3.5 시리즈의 경우, 397B A17B 모델이 GLM-5와 Minimax M2.5를 앞질렀으나 토큰 사용량이 많았다. 반면 35B 및 122B 모델은 추론 과정이 출력에 포함되는 등의 버그가 발견되었다.
기타 모델들의 주요 특징은 다음과 같다:
- Seed 2.0 Pro: 추론 효율성 측면에서 인상적인 성능을 보임.
- GLM-5: 기대보다 낮은 성능을 기록함.
- Minimax M2.5: 출력 형식 오류가 발생하며 GPT-OSS-120B에 뒤처짐.
- Seed 1.8, 2.0 Lite, Mini: 가격 대비 성능이 우수하며 토큰 효율성이 매우 높음.
현재 LisanBench 전체 순위 1위는 Opus 4.5 Thinking이 차지하고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.