AI Briefing

터미널 에이전트용 오픈 RL 레시피 TMax 공개

TMax: A Simple Recipe for Terminal Agents

·2026.06.23 00:38

핵심 내용

터미널 에이전트 성능을 극대화하는 새로운 RL 레시피와 대규모 데이터셋 TMax-15k가 공개되었습니다.

자세히 보기

터미널 에이전트의 성능을 프론티어 모델 수준으로 끌어올리기 위한 새로운 강화학습(RL) 레시피인 TMax가 공개되었습니다.

주요 공개 사항은 다음과 같습니다:

  • TMax-15k 데이터셋: 난이도와 다양성을 정밀하게 제어할 수 있는 구성형 파이프라인을 통해 구축된 14,600개의 RL 환경 데이터셋입니다. 이는 기존의 가장 큰 오픈 터미널 데이터셋보다 2.5배 이상 규모가 큽니다.
  • RL 레시피: GRPO와 안정성 개선 기법을 결합한 단순한 Outcome-only RL 방식을 제안합니다.

성능 지표:

  • TMax-9B: Terminal Bench 2.0에서 **27.2%**를 기록하며, 10B 미만 모델 중 최상위권 성능을 보였습니다. 이는 Claude Haiku 4.5(29.8%)에 근접하는 수치입니다.
  • TMax-27B: 성능이 **42.7%**까지 향상되어, Kimi K2.5(43.2%)와 같은 거대 모델의 성능에 근접하는 결과를 보여주었습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.