책상 위의 데이터센터, Dell Pro Max GB10 AI 워크스테이션 실사용기
Dell Pro Max GB10은 128GB 통합 메모리로 70B급 LLM을 로컬에서 실시간 구동했다.
Dell Pro Max GB10 AI 워크스테이션은 Grace Blackwell 구조를 바탕으로 20코어 ARM CPU와 Blackwell GPU를 한 패키지에 묶고, 128GB LPDDR5x 통합 메모리와 273GB/s 대역폭으로 CPU-GPU 병목을 줄였다. NVLink-C2C 기반 통합 설계 덕분에 로컬에서 대형 모델을 그대로 올려 다루는 데 초점이 맞춰져 있다.
초기 설정은 예상보다 단순하다. 전원을 넣으면 **NVIDIA DGX OS(Ubuntu 24.04 LTS 기반)**가 바로 올라오고, uname -m은 aarch64로 확인된다. Docker와 NVIDIA Container Toolkit, 드라이버와 CUDA가 사전 구성돼 있어 컨테이너를 바로 실행해 실험을 시작할 수 있다.
연결성도 워크스테이션 수준을 넘는다.
- Wi-Fi 7, Bluetooth 5.4 지원
- USB-C 3.2 Gen 2 3개, HDMI 2.1b, 10GbE 포트
- 2개의 200Gbps ConnectX-7 SmartNIC로 최대 2대 클러스터링, 256GB 통합 메모리 구성 가능
벤치마크는 Meta-Llama-3.3-70B-Instruct를 NVFP4로 양자화해 TensorRT-LLM 1.2.0rc6.post3로 서빙하는 방식으로 진행됐다. 원래 FP16 기준 약 140GB가 필요한 70B 모델이 서빙 시 약 60GB VRAM으로 내려갔고, 출력 처리량은 198.31 tokens/sec, TTFT 661.42ms, ITL 240.41ms, p99 903ms를 기록했다.
정확도 손실은 제한적이었다.
- BF16: MMLU 83.3, GSM8K_COT 95.3, ARC Challenge 93.7
- FP4: MMLU 81.1, GSM8K_COT 92.6, ARC Challenge 93.3
장점은 128GB 통합 메모리, 100W 이하의 전력 소모, 그리고 거의 들리지 않는 소음이다. 반대로 ARM aarch64 생태계 호환성 문제와, 메모리나 GPU를 개별적으로 업그레이드할 수 없는 구조적 한계가 남는다.
결론적으로 이 장비는 범용 워크스테이션보다 개인용 AI 개발 노드에 가깝다. 클라우드 없이 70B급 모델을 그대로 로드하고, RAG와 다중 모델 파이프라인까지 책상 위에서 실험할 수 있게 만든다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.