Skip to main content

GPU 워크로드 개요

카카오클라우드 GPU 환경에서는 할당받은 Kubernetes 네임스페이스에서 GPU 워크로드를 실행하고, Queue와 Scheduler를 이용해 자원을 배치하며, NVIDIA Dynamo 또는 KServe로 대규모 언어 모델을 서빙할 수 있습니다.

주요 구성 요소

구성 요소역할
KueueGPU 자원 요청을 Queue에서 대기시키고, 가용 자원과 우선순위에 따라 실행 또는 선점 처리
KAI SchedulerGPU 워크로드의 Gang Scheduling과 Network Topology 기반 배치 수행
VolcanoGang Scheduling과 Network Topology 기반 배치 수행
Gateway네임스페이스의 모델 서빙 엔드포인트를 외부 호스트명으로 노출하고 인증 및 트래픽 정책 적용
NVIDIA Dynamo분산 추론 그래프를 구성하고 OpenAI 호환 API 제공
KServeLLMInferenceService를 사용해 Prefill과 Decode가 분리된 추론 환경 구성

사용 흐름

  1. 사용 전 준비에서 네임스페이스, PVC, Gateway 등 공통 리소스를 확인합니다.
  2. Queue와 Scheduler 사용을 참고하여 GPU 워크로드의 대기열과 배치 방식을 설정합니다.
  3. Gateway 구성을 참고하여 인증과 외부 라우팅 정책을 준비합니다.
  4. 워크로드 특성에 따라 NVIDIA Dynamo 또는 KServe LLMInferenceService를 사용해 모델을 배포합니다.
안내

Queue를 사용하려면 담당 CS 채널을 통해 사전 접수해야 합니다.