AI Briefing

Grok 3 Beta — 추론 에이전트의 시대

·2025.02.19 00:00

xAI가 강화 학습을 통해 추론 능력을 극대화한 Grok 3와 Grok 3 mini를 공개했다.

xAI가 강력한 추론 능력과 방대한 사전 학습 지식을 결합한 Grok 3의 초기 프리뷰를 공개했다. Colossus supercluster에서 이전 SOTA 모델 대비 10배의 컴퓨팅 자원을 투입해 학습되었으며, 수학, 코딩, 세계 지식 및 지시 이행 능력에서 비약적인 발전을 이루었다.

특히 대규모 **강화 학습(RL)**을 통해 정교해진 Grok 3 (Think) 모델은 복잡한 문제를 해결할 때 수 초에서 수 분 동안 스스로 사고하며 오류를 수정하고 대안을 탐색한다. 사용자는 Think 버튼을 통해 모델의 최종 답변뿐만 아니라 사고 과정(Chain-of-Thought)을 직접 확인할 수 있다.

주요 벤치마크 성능은 다음과 같다:

  • Chatbot Arena Elo 점수: 1402점
  • AIME 2025: 93.3% (cons@64 적용 시)
  • GPQA (대학원 수준 추론): 84.6%
  • LiveCodeBench (코드 생성): 79.4%

또한, 비용 효율적인 추론을 위한 Grok 3 mini도 함께 선보였다. Grok 3 mini는 STEM 작업에 최적화되어 AIME 2024에서 95.8%, LiveCodeBench에서 80.4%의 높은 성적을 기록했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.