사용 전 준비
GPU 워크로드를 배포하기 전에 네임스페이스, Queue, 모델 파일, Gateway 등 공통 리소스를 확인합니다.
필요한 환경
| 항목 | 설명 |
|---|---|
| Kubernetes 네임스페이스 | GPU 워크로드와 서빙 리소스를 생성할 사용자 전용 네임스페이스 |
kubectl | 할당받은 클러스터와 네임스페이스에 접근하도록 구성된 Kubernetes CLI |
| LocalQueue | Kueue가 GPU 자원 요청을 관리할 때 사용하는 네임스페이스 단위 Queue |
| 모델 PVC | 모델 가중치를 저장한 PVC. 이 가이드에서는 models를 예시로 사용 |
| Gateway | 네임스페이스와 같은 이름으로 미리 생성된 Gateway |
| NetworkAttachmentDefinition | InfiniBand를 사용하는 워크로드에 연결할 네트워크 정의. 네임스페이스와 같은 이름 사용 |
| 외부 호스트명 | *.moduai.kakaocloud.com 도메인에서 모델 서빙에 사용할 호스트명 |
안내
Queue를 사용하려면 담당 CS 채널을 통해 사전 접수해야 합니다.
리소스 확인
-
현재 컨텍스트와 기본 네임스페이스를 확인합니다.
kubectl config current-context
kubectl config view --minify --output 'jsonpath={..namespace}' -
네임스페이스에 제공된 공통 리소스를 확인합니다.
kubectl get localqueue
kubectl get pvc models
kubectl get gateway
kubectl get network-attachment-definitions -
모델 PVC에 모델 파일이 준비되어 있는지 확인합니다. 모델 경로는 사용하는 서빙 런타임의
model또는uri설정과 일치해야 합니다.
예시의 치환값
이 문서에서 사용하는 <...> 표기는 사용자가 실제 환경에 맞게 변경해야 하는 값입니다.
| 표기 | 설명 | 예시 |
|---|---|---|
<사용자 namespace> | 할당받은 Kubernetes 네임스페이스 | gpu-team-a |
<Queue 이름> | 네임스페이스에 생성한 LocalQueue 이름 | serving |
<서비스명> | 모델 서빙 리소스 이름 | glm-5-3 |
<모델 경로> | models PVC 내부의 모델 디렉터리 | GLM-5.3 |
<호스트명> | Gateway에서 사용할 외부 호스트명 | glm-5-3.moduai.kakaocloud.com |
<API 키> | Gateway 인증에 사용할 API 키 | 사용자 환경에서 발급한 값 |
YAML 적용 방법
예시 YAML을 파일로 저장한 후 적용합니다.
kubectl apply -f <파일명>.yaml
여러 파일을 함께 관리하려면 같은 디렉터리에 kustomization.yaml을 작성한 후 적용합니다.
kubectl apply -k <디렉터리>
주의
예시의 CPU, 메모리, GPU, InfiniBand NIC 수는 GLM-5.3 기준입니다. 다른 모델이나 노드 사양을 사용할 때는 모델 요구 사항과 할당량에 맞게 조정하세요.