1. 개요
Amazon Bedrock은 모델 호출 시 발생하는 트래픽을 제어하기 위해 두 가지 런타임 쿼터를 적용합니다.
TPM (Tokens Per Minute): 분당 처리 가능한 입력·출력 토큰의 합계 한도
RPM (Requests Per Minute): 분당 처리 가능한 추론 요청 횟수 한도
두 쿼터 모두 모델별, 리전별로 독립적으로 적용되며, 복수의 고객이 동일한 인프라를 공정하게 사용할 수 있도록 서비스 안정성을 보장하는 역할을 합니다.(그 외의 쿼타는 아래를 참고)
교차 리전 추론 프로파일(Cross-Region Inference Profile)을 사용하는 경우, 단일 리전 온디맨드 쿼터와는 별도로 Cross-Region 전용 TPM/RPM 쿼터가 적용됩니다. 프로덕션 워크로드에서 쿼터 한도에 도달하면 ThrottlingException이 발생하므로, 예상 사용량에 맞게 사전에 증량을 요청해야 합니다.
단, RPM 쿼터는 모든 모델에 존재하지 않습니다. Claude Opus 4 계열 등 일부 최신 모델은 RPM 없이 TPM 쿼터만 적용됩니다. 정확한 쿼터 항목은 AWS Service Quotas 콘솔에서 확인하시기 바랍니다.
2. 본문
AWS Console에 접속하여 Service Quotas를 검색 후 클릭합니다.
좌측 사이드바 AWS 서비스를 클릭하고 Bedrock을 검색 후 Amazon Bedrock을 클릭합니다.
할당량 증가를 원하는 모델에 대해서 Cross-Region InvokeModel tokens per minute for ${model}, On-demand InvokeModel tokens per minute for ${model}, Model invocation max tokens per day for ${model}, InvokeModel requests per minute for ${model} 등을 검색 후 클릭하여 계정 수준에서 증가 요청 버튼을 클릭합니다.
이후 할당량 값 증가 항목에서 할당량을 입력 후 요청 버튼을 클릭하여 요청합니다.
3. 참고 문서
댓글
댓글 0개
이 문서에는 댓글을 달 수 없습니다.