Skip to main content

사용 전 준비

GPU 워크로드를 배포하기 전에 네임스페이스, Queue, 모델 파일, Gateway 등 공통 리소스를 확인합니다.

필요한 환경

항목설명
Kubernetes 네임스페이스GPU 워크로드와 서빙 리소스를 생성할 사용자 전용 네임스페이스
kubectl할당받은 클러스터와 네임스페이스에 접근하도록 구성된 Kubernetes CLI
LocalQueueKueue가 GPU 자원 요청을 관리할 때 사용하는 네임스페이스 단위 Queue
모델 PVC모델 가중치를 저장한 PVC. 이 가이드에서는 models를 예시로 사용
Gateway네임스페이스와 같은 이름으로 미리 생성된 Gateway
NetworkAttachmentDefinitionInfiniBand를 사용하는 워크로드에 연결할 네트워크 정의. 네임스페이스와 같은 이름 사용
외부 호스트명*.moduai.kakaocloud.com 도메인에서 모델 서빙에 사용할 호스트명
안내

Queue를 사용하려면 담당 CS 채널을 통해 사전 접수해야 합니다.

리소스 확인

  1. 현재 컨텍스트와 기본 네임스페이스를 확인합니다.

    kubectl config current-context
    kubectl config view --minify --output 'jsonpath={..namespace}'
  2. 네임스페이스에 제공된 공통 리소스를 확인합니다.

    kubectl get localqueue
    kubectl get pvc models
    kubectl get gateway
    kubectl get network-attachment-definitions
  3. 모델 PVC에 모델 파일이 준비되어 있는지 확인합니다. 모델 경로는 사용하는 서빙 런타임의 model 또는 uri 설정과 일치해야 합니다.

예시의 치환값

이 문서에서 사용하는 <...> 표기는 사용자가 실제 환경에 맞게 변경해야 하는 값입니다.

표기설명예시
<사용자 namespace>할당받은 Kubernetes 네임스페이스gpu-team-a
<Queue 이름>네임스페이스에 생성한 LocalQueue 이름serving
<서비스명>모델 서빙 리소스 이름glm-5-3
<모델 경로>models PVC 내부의 모델 디렉터리GLM-5.3
<호스트명>Gateway에서 사용할 외부 호스트명glm-5-3.moduai.kakaocloud.com
<API 키>Gateway 인증에 사용할 API 키사용자 환경에서 발급한 값

YAML 적용 방법

예시 YAML을 파일로 저장한 후 적용합니다.

kubectl apply -f <파일명>.yaml

여러 파일을 함께 관리하려면 같은 디렉터리에 kustomization.yaml을 작성한 후 적용합니다.

kubectl apply -k <디렉터리>
주의

예시의 CPU, 메모리, GPU, InfiniBand NIC 수는 GLM-5.3 기준입니다. 다른 모델이나 노드 사양을 사용할 때는 모델 요구 사항과 할당량에 맞게 조정하세요.