터미널 에이전트용 오픈 RL 레시피 TMax 공개
TMax: A Simple Recipe for Terminal Agents
·2026.06.23 00:38
핵심 내용
터미널 에이전트 성능을 극대화하는 새로운 RL 레시피와 대규모 데이터셋 TMax-15k가 공개되었습니다.
자세히 보기
터미널 에이전트의 성능을 프론티어 모델 수준으로 끌어올리기 위한 새로운 강화학습(RL) 레시피인 TMax가 공개되었습니다.
주요 공개 사항은 다음과 같습니다:
- TMax-15k 데이터셋: 난이도와 다양성을 정밀하게 제어할 수 있는 구성형 파이프라인을 통해 구축된 14,600개의 RL 환경 데이터셋입니다. 이는 기존의 가장 큰 오픈 터미널 데이터셋보다 2.5배 이상 규모가 큽니다.
- RL 레시피: GRPO와 안정성 개선 기법을 결합한 단순한 Outcome-only RL 방식을 제안합니다.
성능 지표:
- TMax-9B: Terminal Bench 2.0에서 **27.2%**를 기록하며, 10B 미만 모델 중 최상위권 성능을 보였습니다. 이는 Claude Haiku 4.5(29.8%)에 근접하는 수치입니다.
- TMax-27B: 성능이 **42.7%**까지 향상되어, Kimi K2.5(43.2%)와 같은 거대 모델의 성능에 근접하는 결과를 보여주었습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.