Intel, 경량 수학 에이전트 DeepMath 공개
DeepMath: A lightweight math reasoning Agent with smolagents
·2025.12.04 09:00
Qwen3-4B 기반 DeepMath는 Python 코드를 활용해 수학 추론 정확도를 높이고 출력 길이를 66% 단축했다.
Intel AI Software Group이 공개한 DeepMath는 Qwen3-4B Thinking 모델을 기반으로 하며, **GRPO(Group Relative Policy Optimization)**를 통해 미세 조정된 경량 수학 추론 에이전트입니다.
기존 LLM의 긴 텍스트 기반 추론(Chain-of-Thought) 방식이 가진 연산 오류와 과도한 출력 길이를 해결하기 위해 설계되었습니다. 모델은 긴 설명 대신 짧은 Python 스니펫을 생성하며, 이는 smolagents 라이브러리를 통해 안전한 샌드박스 환경에서 실행된 후 결과가 다시 추론 과정에 통합됩니다.
주요 성과 및 특징:
- MATH500, AIME, HMMT, HLE 등 주요 수학 데이터셋에서 성능 검증
- 수학 에이전트 활용 시 출력 길이를 최대 66% 감소시키면서도 정확도 향상
- GRPO 학습을 통해 코드 생성 중심의 간결하고 결정론적인 추론 방식 강화
- vLLM과 TRL을 활용한 효율적인 추론 및 학습 환경 구축
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.