AI Briefing

DeepSeek, GPT-5.2급 성능 달성

DeepSeek V4 Pro matches GPT-5.2 on FoodTruck Bench, our agentic benchmark — 10 weeks later, ~17× cheaper

·2026.05.05 15:51

DeepSeek V4 Pro가 에이전트 벤치마크에서 GPT-5.2급 성능을 내면서도 비용은 17배 저렴한 것으로 나타났다.

에이전트 성능 측정 도구인 FoodTruck Bench 테스트 결과, DeepSeek V4 Pro가 GPT-5.2와 대등한 수준의 성과를 기록하며 프론티어급 모델로 진입했다.

주요 분석 결과는 다음과 같다:

  • 성능 및 순위: 전체 순위 4위를 기록했다. Grok 4.3과 결과값은 비슷하지만, 음식 낭비 감소 및 식사 제공 횟수 증가 등 실행 일관성 면에서 우위를 점했다.
  • 압도적 비용 효율성: GPT-5.2 대비 에이전트 워크로드 기준 약 17배 저렴한 비용으로 동일한 성능을 제공한다. 비용 효율성(API 지출 대비 순자산) 측면에서는 Gemma 4 31B에 이어 전체 2위를 차지했다.
  • 기술 격차 축소: 과거 미국과 중국 모델 간의 격차가 1년 정도였다면, 현재는 약 10주 수준으로 좁혀졌다.
  • 중국 모델의 약진: Xiaomi MiMo v2.5 Pro 또한 벤치마크 6위에 오르며, 저렴한 가격대의 중국 모델들이 에이전트 시장에서 강력한 경쟁력을 보이고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.