모델 서빙
네임스페이스에 제공된 Gateway를 구성하고 NVIDIA Dynamo 또는 KServe로 대규모 언어 모델을 서빙합니다.
📄️ Gateway 구성
네임스페이스에 제공된 Gateway에 인증, 라우팅, 트래픽, Rate Limit 정책을 구성하는 방법을 안내합니다.
📄️ NVIDIA Dynamo로 모델 서빙
DynamoGraphDeployment로 GLM-5.3을 배포하고 서빙 엔드포인트를 Gateway에 연결하는 방법을 안내합니다.
📄️ KServe LLMInferenceService로 모델 서빙
KServe LLMInferenceService로 GLM-5.3을 Prefill과 Decode 분리 구조로 서빙하는 방법을 안내합니다.