엔드포인트 생성
모델 카탈로그의 기본 제공 모델 또는 커스텀 모델을 엔드포인트로 배포할 수 있습니다. 모델 실행에 필요한 리소스, 로깅과 API 제한 정책은 엔드포인트를 생성할 때 설정합니다.
사전 준비
- 프로젝트에서 Advanced AI Space 서비스를 시작해야 합니다.
- 배포할 모델을 확인합니다. 자체 모델을 사용하려면 커스텀 모델을 먼저 생성하세요.
- 워크로드에 필요한 인스턴스 유형, 리소스 프로파일과 Replica 수를 결정합니다.
생성 화면 열기
-
AI Service > Advanced AI Space 메뉴로 이동합니다.
-
다음 방법 중 하나로 엔드포인트 생성 화면을 엽니다.
- 엔드포인트 메뉴에서 생성: 엔드포인트 메뉴에서 [엔드포인트 생성] 버튼을 클릭한 후 배포할 모델을 선택합니다.
- 모델 목록에서 생성: 모델 카탈로그 > 기본 제공 모델 또는 모델 카탈로그 > 커스텀 모델 메뉴에서 모델을 선택한 후 [엔드포인트 생성] 버튼을 클릭합니다.
- 모델 상세에서 생성: 모델 이름을 클릭한 후 모델 상세 화면에서 [엔드포인트 생성] 버튼을 클릭합니다. 선택한 모델이 생성 화면에 자동으로 설정됩니다.
기본 정보 설정
| 항목 | 설명 |
|---|---|
| 모델 | 배포할 기본 제공 모델 또는 커스텀 모델 선택 모델 목록이나 상세 화면에서 진입 시 선택한 모델 자동 설정 |
| 엔드포인트 이름 | 영문, 숫자, 하이픈(-), 언더바(_)로 2~30자 입력 |
| 도메인 ID | 엔드포인트 URL에 사용할 도메인 ID 영문 소문자, 숫자, 하이픈( -)으로 1~20자 입력 기존 엔드포인트와 중복 시 무작위 DNS Safe 접미사 추가 |
리소스 설정
| 항목 | 설명 |
|---|---|
| 인스턴스 유형 | 모델 실행용 인스턴스 유형 선택 |
| Replica 수 | 엔드포인트를 구성할 Replica 수 선택 |
| Replica 무중단 배포 설정 | 무중단 배포 선택 시 새 Replica가 준비된 후 기존 Replica 종료 (배포 중 일시적인 추가 리소스 사용으로 요금 발생 가능) |
| 리소스 프로파일 | 선택한 인스턴스에서 사용할 리소스 프로파일 선택 |
| 리소스 수 | Replica별 리소스 수 선택 선택 결과에 따른 최대 vCPU와 최대 Memory 확인 |
로깅 설정
로그를 저장하려면 Logging 설정을 사용으로 변경한 후 Object Storage 버킷 정보에서 버킷을 선택합니다. 로그는 선택한 버킷의 predictor 경로에 자동으로 저장됩니다. 날짜별 폴더명은 UTC를 기준으로 생성됩니다.
API 제한 설정(Tier)
API 제한은 선택 사항입니다. 엔드포인트에 여러 Tier를 추가하고 각 Tier마다 필요한 제한값을 설정할 수 있습니다.
-
API 제한 설정을 사용으로 변경합니다.
-
Tier별 제한 정보를 입력합니다.
항목 설명 Tier 이름 API 키 연결 시 구분할 Tier 이름 요청 수 한도(Total Request) Tier에서 허용할 전체 요청 수 입력 토큰 한도(Input Token) Tier에서 허용할 입력 토큰 수 출력 토큰 한도(Output Token) Tier에서 허용할 출력 토큰 수 사용량 집계 주기(Reset Period) 제한 사용량 집계 및 초기화 주기 -
Tier가 더 필요하면 [Tier 추가]를 클릭합니다.
제한값을 설정하지 않은 Tier도 생성할 수 있으며, 이 경우 사용량 집계 주기를 설정하지 않습니다.
API 키에 Tier 적용
Tier는 엔드포인트에 등록하는 정책입니다. API 키를 해당 엔드포인트에 연결할 때 등록된 Tier 중 하나를 선택하거나, Tier 없이 연결할 수 있습니다.
생성 완료
- 설정 내용을 확인한 후 [생성] 버튼을 클릭합니다.
- 엔드포인트 목록에서 상태를 확인합니다.
- 상태가
Active로 변경되면 엔드포인트 상세 화면에서 URL을 확인하고 추론 요청을 보낼 수 있습니다.
엔드포인트를 생성한 후 API 키를 생성하고 엔드포인트에 연결해야 호출할 수 있습니다.