2억 유로 규모의 슈퍼컴퓨터에서 코드를 실행하는 데 실제로 필요한 것
·2026.05.05 08:37
스페인의 MareNostrum V 슈퍼컴퓨터 아키텍처와 SLURM을 이용한 실제 운영 방식을 설명한다.
바르셀로나 카탈루냐 공대의 MareNostrum V는 2억 유로 규모의 공공 연구 인프라로, 세계 15대 슈퍼컴퓨터 중 하나입니다. 이 시스템은 단일 컴퓨터가 아니라 수천 대의 독립 노드가 InfiniBand NDR200 팻트리(fat-tree) 토폴로지로 연결되어 비차단(non-blocking) 대역폭을 보장하는 분산 컴퓨팅 환경입니다.
주요 컴퓨팅 파티션
- 범용 파티션(GPP): 고도 병렬 CPU 작업을 위해 설계되었습니다.
- 가속 파티션(ACC): AI 훈련 및 분자 동역학을 위해 NVIDIA H100 SXM GPU를 탑재하고 있습니다.
- 로그인 노드: SSH 접속, 파일 이동, 코드 컴파일 및 작업 제출을 위한 경량 작업 전용 노드입니다.
운영 및 워크로드 관리
- 에어갭(Airgap) 환경: 보안을 위해 외부 인터넷 접속이 차단되어 있습니다. 따라서
pip install등이 불가능하며, 필요한 모든 라이브러리와 데이터셋을 사전에 준비해야 합니다. 실제 계산 속도가 매우 빨라 결과 데이터를 추출하는 과정이 병목이 되기도 합니다. - SLURM 워크로드 매니저: 사용자는 배치 스크립트를 통해 필요한 노드 수, 태스크 수, 실행 시간 제한 등을 명시하여 작업을 큐에 제출합니다. 모든 작업은 엄격한 wall-time 제한을 따르며, 이를 초과하면 프로세스가 즉시 종료됩니다.
- 양자 인프라: 디지털 게이트 및 초전도 큐비트 기반의 양자 시스템이 통합되어, 클래식 슈퍼컴퓨터가 처리하기 어려운 최적화 문제를 해결하는 하이브리드 클래식-양자 컴퓨팅을 구현합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.