モデルレートページは、AIサービスにおける各モデルタイプの呼び出しレート制限を表示するために使用されます。このページから、各モデルの1分あたりのToken上限(TPM)と1分あたりのリクエスト数上限(RPM)を確認でき、アプリケーションの接続、呼び出し戦略の設計、レート制限問題の調査に役立てることができます。
上部ナビゲーションバーの組織アカウント名をクリックして、モデルレートページに移動します。
レート制限・クォータの説明
- モデルレート上限:現在の組織レベルで適用される最高制限です。
- AIサービスは通常、1分あたりのToken(
TPM)と1分あたりのリクエスト数(RPM)の2つの側面から制限をかけます。 - 制限超過時の処理方法:ある1分間のTokenまたはリクエスト数が制限を超えた場合、残りの分間の後続リクエストが制限される可能性があります。これは、リソース利用の公平性とシステムの安定性を確保するためです。業務により高いレート設定が必要な場合は、ページの指示に従ってサポートチャネルにお問い合わせください。
リストエリアでは、モデルタイプごとに現在使用可能なモデルと対応するレート上限情報が表示されます。通常、以下のフィールドが含まれます:
フィールド |
説明 |
|---|---|
| タイプ | モデルが属するタスクタイプ。例:chat、embedding、rerank、vl-embedding、vl-rerank。 |
| モデル | そのタイプで利用可能な具体的なモデル名。 |
| 1分あたりのToken数(TPM) | そのタイプのモデルが1分間に消費できる最大Token数です。業務上、1回のリクエストでテキストが長い場合や、モデルの出力が多い場合は、リクエスト回数が多くなくても、まずTPMの制限に達する可能性があります。 |
| 1分あたりのリクエスト数(RPM) | そのタイプのモデルが1分間に発生できる最大リクエスト数です。業務上、リクエストが軽量でも呼び出し頻度が高い場合は、まずRPMの制限に達する可能性があります。 |
適用シナリオ
モデルレート情報は、以下のシナリオに適用されます:
アプリケーション接続評価:アプリケーションがAIサービスに接続する前に、現在のモデルレートが業務のピークニーズを満たしているかどうかを評価します。
レート制限問題の調査:呼び出しが失敗したり、リクエストが拒否されたり、応答が異常だったりした場合、
TPMまたはRPMの制限がトリガーされたかどうかを判断します。呼び出し戦略の最適化:各モデルタイプのレート制限に基づいて、リクエスト頻度、バッチ処理方式、業務の再試行戦略を最適化します。
容量計画:業務の成長に先立ち、より高いレートクォータを申請する必要があるかどうかを事前に評価します。
使用上の推奨事項
アプリケーション側では、リクエスト回数だけでなく、
TPMとRPMの両方に注目してください。高同時実行業務では、瞬間的なトラフィックによってプラットフォームのレート流量制限がトリガーされるのを防ぐため、ローカルレート制限、キューイング、または再試行メカニズムを追加してください。
単一リクエストの入力が長い場合や出力が大きい場合は、
TPMの消費状況に特に注意してください。プラットフォームのレート流量制限がトリガーされるのを防ぐため、組織レベルの呼び出しピークを統一的に計画してください。