AI Briefing

2억 유로 규모의 슈퍼컴퓨터에서 코드를 실행하는 데 실제로 필요한 것

·2026.05.05 08:37

스페인의 MareNostrum V 슈퍼컴퓨터 아키텍처와 SLURM을 이용한 실제 운영 방식을 설명한다.

바르셀로나 카탈루냐 공대의 MareNostrum V는 2억 유로 규모의 공공 연구 인프라로, 세계 15대 슈퍼컴퓨터 중 하나입니다. 이 시스템은 단일 컴퓨터가 아니라 수천 대의 독립 노드가 InfiniBand NDR200 팻트리(fat-tree) 토폴로지로 연결되어 비차단(non-blocking) 대역폭을 보장하는 분산 컴퓨팅 환경입니다.

주요 컴퓨팅 파티션

  • 범용 파티션(GPP): 고도 병렬 CPU 작업을 위해 설계되었습니다.
  • 가속 파티션(ACC): AI 훈련 및 분자 동역학을 위해 NVIDIA H100 SXM GPU를 탑재하고 있습니다.
  • 로그인 노드: SSH 접속, 파일 이동, 코드 컴파일 및 작업 제출을 위한 경량 작업 전용 노드입니다.

운영 및 워크로드 관리

  • 에어갭(Airgap) 환경: 보안을 위해 외부 인터넷 접속이 차단되어 있습니다. 따라서 pip install 등이 불가능하며, 필요한 모든 라이브러리와 데이터셋을 사전에 준비해야 합니다. 실제 계산 속도가 매우 빨라 결과 데이터를 추출하는 과정이 병목이 되기도 합니다.
  • SLURM 워크로드 매니저: 사용자는 배치 스크립트를 통해 필요한 노드 수, 태스크 수, 실행 시간 제한 등을 명시하여 작업을 큐에 제출합니다. 모든 작업은 엄격한 wall-time 제한을 따르며, 이를 초과하면 프로세스가 즉시 종료됩니다.
  • 양자 인프라: 디지털 게이트 및 초전도 큐비트 기반의 양자 시스템이 통합되어, 클래식 슈퍼컴퓨터가 처리하기 어려운 최적화 문제를 해결하는 하이브리드 클래식-양자 컴퓨팅을 구현합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.