GPU 워크로드 개요
카카오클라우드 GPU 환경에서는 할당받은 Kubernetes 네임스페이스에서 GPU 워크로드를 실행하고, Queue와 Scheduler를 이용해 자원을 배치하며, NVIDIA Dynamo 또는 KServe로 대규모 언어 모델을 서빙할 수 있습니다.
주요 구성 요소
| 구성 요소 | 역할 |
|---|---|
| Kueue | GPU 자원 요청을 Queue에서 대기시키고, 가용 자원과 우선순위에 따라 실행 또는 선점 처리 |
| KAI Scheduler | GPU 워크로드의 Gang Scheduling과 Network Topology 기반 배치 수행 |
| Volcano | Gang Scheduling과 Network Topology 기반 배치 수행 |
| Gateway | 네임스페이스의 모델 서빙 엔드포인트를 외부 호스트명으로 노출하고 인증 및 트래픽 정책 적용 |
| NVIDIA Dynamo | 분산 추론 그래프를 구성하고 OpenAI 호환 API 제공 |
| KServe | LLMInferenceService를 사용해 Prefill과 Decode가 분리된 추론 환경 구성 |
사용 흐름
- 사용 전 준비에서 네임스페이스, PVC, Gateway 등 공통 리소스를 확인합니다.
- Queue와 Scheduler 사용을 참고하여 GPU 워크로드의 대기열과 배치 방식을 설정합니다.
- Gateway 구성을 참고하여 인증과 외부 라우팅 정책을 준비합니다.
- 워크로드 특성에 따라 NVIDIA Dynamo 또는 KServe LLMInferenceService를 사용해 모델을 배포합니다.
안내
Queue를 사용하려면 담당 CS 채널을 통해 사전 접수해야 합니다.