AI Briefing

Intel, 경량 수학 에이전트 DeepMath 공개

DeepMath: A lightweight math reasoning Agent with smolagents

·2025.12.04 09:00

Qwen3-4B 기반 DeepMath는 Python 코드를 활용해 수학 추론 정확도를 높이고 출력 길이를 66% 단축했다.

Intel AI Software Group이 공개한 DeepMathQwen3-4B Thinking 모델을 기반으로 하며, **GRPO(Group Relative Policy Optimization)**를 통해 미세 조정된 경량 수학 추론 에이전트입니다.

기존 LLM의 긴 텍스트 기반 추론(Chain-of-Thought) 방식이 가진 연산 오류와 과도한 출력 길이를 해결하기 위해 설계되었습니다. 모델은 긴 설명 대신 짧은 Python 스니펫을 생성하며, 이는 smolagents 라이브러리를 통해 안전한 샌드박스 환경에서 실행된 후 결과가 다시 추론 과정에 통합됩니다.

주요 성과 및 특징:

  • MATH500, AIME, HMMT, HLE 등 주요 수학 데이터셋에서 성능 검증
  • 수학 에이전트 활용 시 출력 길이를 최대 66% 감소시키면서도 정확도 향상
  • GRPO 학습을 통해 코드 생성 중심의 간결하고 결정론적인 추론 방식 강화
  • vLLMTRL을 활용한 효율적인 추론 및 학습 환경 구축

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.