AI Briefing

RON-TAC 전술 AI

RON-TAC: Closed-Loop Imitation Learning for Cooperative Tactical AI in Ready or Not (UE5.3)

·2026.04.21 01:44

핵심 내용

Ready or Not에서 인간 시연으로 전술 AI를 학습시키는 DAgger 파이프라인.

자세히 보기

Ready or Not(UE5.3) 안에서 인간 시연을 직접 수집해 multi-agent tactical squad policy를 학습하는 DAgger-style imitation learning 파이프라인을 구현했다.

런타임 계측은 UE4SS C++ 모드로 처리한다. 약 3.8 kLOC 단일 .cpp와 약 270 KB DLL이 게임 내부를 훅킹해, D3D11 Present vtable hook으로 384×384 RGB 프레임을 저장하고, SWATManager.Give*Command 전후 훅과 blackboard snapshot으로 dagger.jsonl에 시연 데이터를 기록한다. 활동 전이 감시기는 커스텀 activity-class 매칭으로 [PLAYER]와 하위 행동을 구분한다.

실시간 추론 루프는 Python + Torch 2.x + CUDA로 2 Hz에서 동작한다. T3-Vis(약 40M params, frozen ViT)가 시각 임베딩을 만들고, T3-Tac(39.9M params set-transformer)가 visual token과 구조화된 상태 토큰을 받아 **18-way CommandType**와 팀 배정(SQUAD/RED/BLUE/GOLD), confidence를 출력한다.

confidence가 임계값을 넘고 중복 명령이 아니면 곧바로 ProcessEvent로 게임에 재주입된다. 플레이어는 1인칭 제어를 계속 유지하고, 언제든 override할 수 있다.

학습 파이프라인은 activity transition을 라벨 텐서로 파싱한 뒤 cross-entropy로 훈련하며, real-data weight 5.0, 선택적 VLM-augmented data 0.3을 사용한다. 정책은 주기적으로 live loop에 교체되어, 인간 시연이 계속 쌓이는 closed-loop human-in-the-loop 개선 사이클을 만든다.

2026-04-19 기준 결과는 다음과 같다.

  • 데이터셋: 1,173개 player-issued command
  • T3-Tac v3 검증 정확도: 0.606 macro
  • HOLD: 100%
  • BREACH: 64%
  • STACK_UP: 54%
  • SEARCH_AND_SECURE: 52%

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.