
AWS 공식 발표에 따르면 Amazon SageMaker HyperPod가 Slurm 기반 클러스터에서 파티션별 네트워크 토폴로지를 지원한다. 하나의 클러스터 안에서도 GPU 인스턴스 구성에 따라 서로 다른 토폴로지를 적용할 수 있어, 분산 학습 작업을 하드웨어 연결 구조에 맞춰 배치할 수 있게 됐다.
이번 기능은 Slurm 25.11 이상을 사용하는 HyperPod 클러스터를 대상으로 한다. AWS는 각 파티션의 컴퓨팅 인스턴스 그룹을 확인한 뒤 적합한 토폴로지를 자동 선택한다. 클러스터를 확장하거나 축소하고 노드를 교체할 때도 구성 파일을 갱신해 실제 자원 상태를 반영한다.
UltraServer 계열인 ml.p6e-gb200.36xlarge 인스턴스로 구성된 파티션에는 블록 토폴로지가 적용된다. 블록 방식은 여러 노드를 균일한 고대역폭 통신 영역으로 묶어 GPU 간 통신 지연 차이를 줄이는 데 초점을 둔다.
ml.p5.48xlarge와 ml.p5e.48xlarge, ml.p5en.48xlarge처럼 계층형 인터커넥트를 사용하는 인스턴스에는 트리 토폴로지가 배정된다. Slurm은 이 구조를 바탕으로 서로 가까운 노드에 작업을 배치해 네트워크 계층을 가로지르는 통신을 줄인다. 네트워크 토폴로지 정보를 제공하지 않는 인스턴스가 포함된 파티션은 플랫 기본값을 이어받아 스케줄링 가능 상태를 유지한다.
기존 Slurm 24.x 환경에서는 클러스터 전체에 하나의 토폴로지만 적용할 수 있었다. Slurm 25.11부터는 topology.yaml에 여러 토폴로지 정의와 파티션별 할당을 함께 기록할 수 있다. P5 파티션과 UltraServer 파티션을 각각 별도 클러스터로 나누지 않고도 하드웨어에 맞는 배치 방식을 사용할 수 있다는 점이 이번 변화의 핵심이다.
토폴로지 인식 스케줄링은 데이터 이동 비용이 큰 대규모 AI 학습에서 중요하다. 다만 실제 처리량 개선 폭은 모델의 통신 패턴과 작업 규모, 인스턴스 구성에 따라 달라진다. AWS는 지원되는 SageMaker HyperPod 리전에서 이 기능을 제공하며, 지원 인스턴스 목록은 EC2 토폴로지 문서를 기준으로 확인하도록 안내했다.
출처: AWS 공식 발표 https://aws.amazon.com/about-aws/whats-new/2026/07/hyperpod-partition-topology-slurm/
출처: Amazon SageMaker HyperPod 공식 문서 https://docs.aws.amazon.com/sagemaker/latest/dg/sagemaker-hyperpod-topology.html









