RON-TAC 전술 AI
RON-TAC: Closed-Loop Imitation Learning for Cooperative Tactical AI in Ready or Not (UE5.3)
핵심 내용
Ready or Not에서 인간 시연으로 전술 AI를 학습시키는 DAgger 파이프라인.
자세히 보기
Ready or Not(UE5.3) 안에서 인간 시연을 직접 수집해 multi-agent tactical squad policy를 학습하는 DAgger-style imitation learning 파이프라인을 구현했다.
런타임 계측은 UE4SS C++ 모드로 처리한다. 약 3.8 kLOC 단일 .cpp와 약 270 KB DLL이 게임 내부를 훅킹해, D3D11 Present vtable hook으로 384×384 RGB 프레임을 저장하고, SWATManager.Give*Command 전후 훅과 blackboard snapshot으로 dagger.jsonl에 시연 데이터를 기록한다. 활동 전이 감시기는 커스텀 activity-class 매칭으로 [PLAYER]와 하위 행동을 구분한다.
실시간 추론 루프는 Python + Torch 2.x + CUDA로 2 Hz에서 동작한다. T3-Vis(약 40M params, frozen ViT)가 시각 임베딩을 만들고, T3-Tac(39.9M params set-transformer)가 visual token과 구조화된 상태 토큰을 받아 **18-way CommandType**와 팀 배정(SQUAD/RED/BLUE/GOLD), confidence를 출력한다.
confidence가 임계값을 넘고 중복 명령이 아니면 곧바로 ProcessEvent로 게임에 재주입된다. 플레이어는 1인칭 제어를 계속 유지하고, 언제든 override할 수 있다.
학습 파이프라인은 activity transition을 라벨 텐서로 파싱한 뒤 cross-entropy로 훈련하며, real-data weight 5.0, 선택적 VLM-augmented data 0.3을 사용한다. 정책은 주기적으로 live loop에 교체되어, 인간 시연이 계속 쌓이는 closed-loop human-in-the-loop 개선 사이클을 만든다.
2026-04-19 기준 결과는 다음과 같다.
- 데이터셋: 1,173개 player-issued command
- T3-Tac v3 검증 정확도: 0.606 macro
HOLD: 100%BREACH: 64%STACK_UP: 54%SEARCH_AND_SECURE: 52%
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.