一部のモデルで、より高速かつ安定したパフォーマンスを求める API のお客様向けに Fast モードを提供しています。以下では、仕組み、料金、利用可能なモデル、レート制限、信頼性、ポリシー、利用資格に関するよくある質問に回答します。
注:Priority processing は 2026 年 7 月 30 日に Fast モードへ名称変更されました。API リクエストでは、service_tier: priority と service_tier: fast のどちらも使用できます。
詳しくはこちらをご覧ください。
Fast モードはすべての地域で利用できますか?
Fast モードの提供可否は、各法域で適用される法令によって異なります。お住まいの地域での提供状況についてご不明な点がある場合は、担当のアカウントディレクターにお問い合わせください。
仕組み
既存の service_tier パラメーターに service_tier = "fast" を指定することで、リクエストごとにトラフィックを Fast モードに送信できます。
Fast モードで処理されるトークンは、標準処理よりも高い単価で、トークンごとに課金されます。
リクエスト単位の設定に加え、プロジェクト設定の「デフォルトのサービスティア」で「Fast」を選択して、プロジェクトのデフォルトを Fast モードに設定することもできます。この場合も、リクエストごとに設定を上書きできます。プロジェクト設定で「Fast」を選択することは、「Priority」を選択することと同じです。
スケールティアとはどのような関係ですか?
スケールティアは、引き続き Fast モードとは別のサービスとして提供されます。Fast モードに送信されたリクエストは別途課金され、購入済みのスケールティアの TPM バンドルは消費しません。
スケールティアの上限を超えたトラフィックを Fast モードに自動的に送信できますか?
いいえ、できません。スケールティアに送信されたトラフィックが上限を超えても、Fast モードに自動的に振り分けられることはありません。
Fast モードはどのように課金されますか?
Fast モードで処理されるトークンは、標準処理よりも高い単価で、トークンごとに課金されます。
年間の利用金額コミットメントは、特定の処理モードに限定されますか?
いいえ、限定されません。すべての処理モードの利用金額が、Enterprise 契約の年間利用金額コミットメントに算入されます。
キャッシュ済み入力トークンにも引き続き割引が適用されますか?
はい、適用されます!キャッシュ済み入力には、標準処理と同じ 50~75% の割引が適用されます。
Fast モードの使用量と利用金額を確認するにはどうすればよいですか?
Fast モード(旧称:優先処理)で処理されたトークン数を確認するには、使用状況ダッシュボードで Chat Completions または Responses を選択し、サービスティア別にグループ化してください。
Fast モードの費用を確認するには、使用状況ダッシュボードで明細項目別のグループ化を選択してください。
使用状況ダッシュボードでは、service_tier に priority と fast のどちらを指定したリクエストも、引き続き priority として表示されます。今後のモデルでは、この表示が更新される予定です。
モデル
Fast モードは、長いコンテキスト、ファインチューニング済みモデル、埋め込みなどでも利用できますか?
現時点では利用できません。最新モデル以外の製品にも Fast モードを提供するかどうかは、今後検討します。
Fast モードは、ほかのモダリティにどのように対応していますか?
Fast モードは、標準処理と同じマルチモーダル機能に対応しています。たとえば、優先処理では画像を入力として使用でき、同じ低レイテンシーで処理されます。
今後のモデルにも対応しますか?
新しい GPT モデルでも Fast モードを提供する予定ですが、すべてのモデルでの対応を保証するものではありません。
レート制限
レート制限はどのように適用されますか?
レート制限において、優先処理の使用量は標準の API トラフィックと同じように扱われます。
ランプレートの制限とは何ですか?
Fast モードでは、柔軟なオンデマンド料金体系を提供しながら、すべてのお客様に安定した高いパフォーマンスを確保するため、ランプレートに制限を設けています。(a) Fast モードのパフォーマンスが低下し、かつ (b) お客様のトラフィックが急激に増加している場合、まれに一部のリクエストが標準処理に切り替わることがあります。
Fast モードの現在のランプレートの制限は、こちらの公式ドキュメントに記載されています。
ランプレートの制限内に収めるためのベストプラクティス
モデルを変更する際は、トラフィックを徐々に増やしてください。たとえば、アプリケーションを以前のスナップショットから新しいスナップショットに移行する場合は、一度に切り替えるのではなく、機能フラグを使って数時間かけてトラフィックを移行してください。
Fast モードで大規模なデータ処理や非同期ジョブを実行することは避けてください。こうしたジョブはトラフィックを急増させる可能性があり、Fast モードによるパフォーマンス向上を必要としない場合も多いためです。
ランプレートの制限に頻繁に達する場合は、代わりにスケールティアの利用枠の購入を検討してください。
ランプレートの制限は、プロジェクトや組織をまたいで共有されますか?
はい、すべてのトラフィックが合算され、同じランプレートの制限が適用されます。
ポリシー
Fast モードがレイテンシーの目標値を満たしていない場合はどうなりますか?
ご質問やご懸念がある場合は、担当の AD にお問い合わせください。Fast モードの SLA は、スケールティアの SLA と同じように扱われます。Enterprise 契約のお客様について、所定の期間内に SLA を満たせなかった場合は、サービスクレジットを提供します。
Fast モードはデータレジデンシーに対応していますか?
はい、対応しています。
Fast モードは ZDR と BAA に対応していますか?
はい、対応しています。
GPT-6 Astra 向け Ultrafast
Ultrafast は、対話型アプリケーションやコーディングのワークフローなど、GPT-6 Astra の応答に低レイテンシーを求めるワークロード向けの独立したサービスティアです。
Fast モードの料金、レート制限、ポリシーに関するガイダンスは、service_tier="fast" を使用するリクエストに適用されます。Ultrafast のリクエストでは、別のティアである service_tier="ultrafast" を使用します。
Ultrafast のリクエストを送信するにはどうすればよいですか?
Ultrafast へのアクセス権がある組織では、以下を指定して Responses API を使用してください。
モデル:
gpt-6-astraサービスティア:
ultrafastリクエストヘッダー:
OpenAI-Service-Tier: ultrafast
サービスティアの設定に加えて、リクエストヘッダーの指定が必要です。
ツール呼び出しを実行するアプリケーションでは、WebSocket モードを使用すると、ターンをまたいで接続を再利用し、接続のオーバーヘッドを削減できます。
ほかのサービスティアでも同じリクエストヘッダーを使用できますか?
Ultrafast のアルファ版では、OpenAI-Service-Tier ヘッダーに指定できる値は ultrafast のみです。default、fast、flex など、ほかの値を送信すると HTTP 400 エラーが返されます。ほかのティアを使用する場合は、このヘッダーを省略してください。
Work や Codex で Ultrafast を利用できますか?
対象のプランやワークスペースでは、Work や Codex でも Ultrafast を利用できます。ChatGPT での対象プランや利用条件は、API アクセスとは異なります。
提供状況と利用に関する詳細は、ChatGPT Work と Codex をご覧ください。
