DeepSeek, GPT-5.2급 성능 달성
DeepSeek V4 Pro matches GPT-5.2 on FoodTruck Bench, our agentic benchmark — 10 weeks later, ~17× cheaper
·2026.05.05 15:51
핵심 내용
DeepSeek V4 Pro가 에이전트 벤치마크에서 GPT-5.2급 성능을 내면서도 비용은 17배 저렴한 것으로 나타났다.
자세히 보기
에이전트 성능 측정 도구인 FoodTruck Bench 테스트 결과, DeepSeek V4 Pro가 GPT-5.2와 대등한 수준의 성과를 기록하며 프론티어급 모델로 진입했다.
주요 분석 결과는 다음과 같다:
- 성능 및 순위: 전체 순위 4위를 기록했다. Grok 4.3과 결과값은 비슷하지만, 음식 낭비 감소 및 식사 제공 횟수 증가 등 실행 일관성 면에서 우위를 점했다.
- 압도적 비용 효율성: GPT-5.2 대비 에이전트 워크로드 기준 약 17배 저렴한 비용으로 동일한 성능을 제공한다. 비용 효율성(API 지출 대비 순자산) 측면에서는 Gemma 4 31B에 이어 전체 2위를 차지했다.
- 기술 격차 축소: 과거 미국과 중국 모델 간의 격차가 1년 정도였다면, 현재는 약 10주 수준으로 좁혀졌다.
- 중국 모델의 약진: Xiaomi MiMo v2.5 Pro 또한 벤치마크 6위에 오르며, 저렴한 가격대의 중국 모델들이 에이전트 시장에서 강력한 경쟁력을 보이고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.