웅진프리드라이프, AWS DRS로 온프레미스 21대 서버 DR 체계 구축
핵심 내용
복제 용량 48TB 중 8%를 제외하고, 복제 서버 사양 최적화로 비용을 약 50% 절감했다.
자세히 보기
웅진프리드라이프는 온프레미스 서버 21대를 대상으로 AWS Elastic Disaster Recovery(AWS DRS) 기반 재해복구 체계를 구축하고 모의 복구 훈련을 수행했다. 보호 대상의 86%가 Windows Server였으며, Windows Server 2012 R2부터 2019까지 여러 세대가 혼재한 레거시 환경이었다. 이번 프로젝트는 마이그레이션 사전 검증과 24시간 운영 서비스의 복구 수단 마련을 목표로 약 4개월간 진행되었다.
복제 구성 및 성능 최적화
초기 동기화 구간에서 약 48TB의 데이터를 처리하기 위해 기존 500Mbps 회선을 1Gbps로 증설했다. 초기 복제 서버로 사용된 t3 계열은 버스터블 인스턴스로 CPU 크레딧 고갈과 EBS 대역폭 제한이 발생하여 성능 저하를 유발했다. 이를 해결하기 위해 복제 서버를 컴퓨팅 최적화 계열인 c6i로 변경하고 EBS 볼륨 처리량을 상향 조정했다. 이후 지속 복제 단계에서는 부하가 낮아져 복제 서버 사양을 c6i.xlarge에서 c6i.large로 하향해 비용을 약 50% 절감했다.
부팅 및 서비스 복구 이슈 대응
Drill 수행 과정에서 복제 상태는 정상이지만 부팅이 실패하거나 서비스가 동작하지 않는 사례가 확인되었다. Windows 서버의 경우 UEFI와 레거시 BIOS 부팅 모드 불일치로 인해 기동이 실패했으며, mbr2gpt 명령어를 통해 GPT로 변환하여 해결했다. Linux 서버는 디바이스 이름 고정 지정으로 인한 부트 경로 오류가 발생해 UUID 기준으로 변경했다. 또한 Active Directory 종속성이 있는 서버는 완전한 기동 복구 대신 데이터 확보를 목표로 재정의하여, 복제된 볼륨을 다른 서버에 연결하는 방식으로 복구 시간을 단축했다.
모니터링 및 운영 체계
복제 지연을 방지하기 위해 CloudWatch 알람을 설정했다. LagDuration 지표가 30분을 초과하면 비상, Backlog 지표가 50GB를 초과하면 경고로 구분하여 대응 우선순위를 정했다. Failover 테스트 결과 서비스 사용 가능 상태까지 최소 30분에서 최대 3시간이 소요되었으며, 이는 누적된 Windows 업데이트 적용 시간 때문이었다. 이를 통해 서버별 복구 목표와 우선순위를 정의한 복구 계획서를 확보했으며, 반기 1회 주기의 정례 Drill을 통해 복구 환경을 검증할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.