Für API-Kunden, die bei bestimmten Modellen eine schnellere und gleichmäßigere Leistung benötigen, bieten wir den Schnellmodus an. Im Folgenden beantworten wir häufige Fragen zu Funktionsweise, Preisen, Modellverfügbarkeit, Ratenlimits, Zuverlässigkeit, Richtlinien und Teilnahmevoraussetzungen.
Hinweis: Priority Processing wurde am 30. Juli 2026 in Schnellmodus umbenannt. In deinen API-Anfragen kannst du entweder service_tier: priority oder service_tier: fast verwenden.
Weitere Informationen findest du hier.
Ist der Schnellmodus in allen Regionen verfügbar?
Die Verfügbarkeit des Schnellmodus richtet sich nach den geltenden Gesetzen und Vorschriften im jeweiligen Rechtsgebiet. Wende dich bei Fragen zur Verfügbarkeit in deiner Region an deinen Account Director.
Funktionsweise
Kunden können Traffic für jede Anfrage einzeln an den Schnellmodus leiten. Dazu verwenden sie den vorhandenen Parameter service_tier mit der Option service_tier = "fast".
Vom Schnellmodus verarbeitete Token werden pro Token abgerechnet. Der Preis liegt über den Tarifen der Standardverarbeitung.
Du kannst den Schnellmodus nicht nur auf Anfrageebene konfigurieren, sondern auch in den Projekteinstellungen als Standard festlegen: Projekteinstellungen > Standard-Servicestufe: Schnell. Du kannst diese Einstellung weiterhin für einzelne Anfragen überschreiben. Die Auswahl von Schnell in deinen Projekteinstellungen entspricht der Auswahl von Priority.
Wie verhält sich der Schnellmodus zum Scale Tier?
Der Scale Tier bleibt vom Schnellmodus getrennt. An den Schnellmodus gesendete Anfragen werden separat abgerechnet und nicht auf deine erworbenen TPM-Pakete des Scale Tier angerechnet.
Kann ich überschüssigen Traffic aus dem Scale Tier automatisch an den Schnellmodus senden?
Nein. An den Scale Tier gesendeter Traffic wird nicht automatisch an den Schnellmodus weitergeleitet.
Wie wird der Schnellmodus abgerechnet?
Vom Schnellmodus verarbeitete Token werden pro Token abgerechnet. Der Preis liegt über den Tarifen der Standardverarbeitung.
Ist meine jährliche Abnahmeverpflichtung an einen bestimmten Verarbeitungsmodus gebunden?
Nein. Alle Verarbeitungsmodi werden auf deine jährliche Enterprise-Abnahmeverpflichtung angerechnet.
Erhalte ich weiterhin einen Rabatt auf zwischengespeicherte Eingabe-Token?
Ja! Für zwischengespeicherte Eingaben gilt derselbe Rabatt von 50 bis 75 % wie bei der Standardverarbeitung.
Wie kann ich Nutzung und Kosten des Schnellmodus einsehen?
Um die vom Schnellmodus (ehemals Priority Processing) verarbeiteten Token anzuzeigen, öffne das Nutzungs-Dashboard, wähle Chat Completions oder Responses und anschließend „Nach Servicestufe gruppieren“.
Um die Kosten des Schnellmodus anzuzeigen, öffne das Nutzungs-Dashboard und wähle „Nach Position gruppieren“.
Im Nutzungs-Dashboard werden Anfragen mit priority oder fast als service_tier weiterhin als priority angezeigt. Dies wird für künftige Modelle aktualisiert.
Modelle
Ist der Schnellmodus für lange Kontexte, feinabgestimmte Modelle, Embeddings und Ähnliches verfügbar?
Derzeit nicht. Wir werden künftig prüfen, ob wir den Schnellmodus neben unseren neuesten Modellen auch für weitere Produkte anbieten.
Wie funktionieren andere Modalitäten mit dem Schnellmodus?
Der Schnellmodus unterstützt dieselben multimodalen Funktionen wie die Standardverarbeitung. Insbesondere können Bilder als Eingaben für Priority Processing verwendet werden und profitieren dabei von derselben kurzen Latenz.
Werden künftige Modelle unterstützt?
Wir planen, den Schnellmodus für neue GPT-Modelle anzubieten, können die Unterstützung jedoch nicht für jedes Modell garantieren.
Ratenlimits
Welche Ratenlimits gelten?
Für die Ratenlimits wird die Nutzung von Priority Processing genauso behandelt wie regulärer API-Traffic.
Welche Limits gelten für schnelle Traffic-Anstiege?
Für den Schnellmodus gelten Limits für schnelle Traffic-Anstiege. So gewährleisten wir eine gleichbleibend hohe Leistung für alle Kunden und bieten zugleich eine flexible bedarfsabhängige Abrechnung. Wenn (a) die Leistung des Schnellmodus beeinträchtigt ist UND (b) der Traffic eines Kunden zu schnell steigt, können in seltenen Fällen einige Anfragen stattdessen auf die Standardverarbeitung zurückgestuft werden.
Das aktuelle Limit für Traffic-Anstiege im Schnellmodus ist hier in unserer zentralen Dokumentation beschrieben.
Empfehlungen zur Einhaltung deines Limits für Traffic-Anstiege
Erhöhe den Traffic bei einem Modellwechsel schrittweise. Wenn deine Anwendung beispielsweise von einem früheren Snapshot auf einen neuen umgestellt wird, solltest du den Traffic mithilfe eines Feature-Flags über mehrere Stunden hinweg verlagern, statt alles auf einmal umzustellen.
Führe keine umfangreichen Datenverarbeitungs- oder asynchronen Jobs im Schnellmodus aus. Bei solchen Jobs kann der Traffic sehr schnell steigen. Häufig benötigen sie die höhere Leistung des Schnellmodus nicht.
Wenn du regelmäßig an die Limits für Traffic-Anstiege stößt, solltest du stattdessen ein Kontingent für den Scale Tier erwerben.
Gelten die Limits für Traffic-Anstiege projekt- oder organisationsübergreifend?
Ja, dein gesamter Traffic wird auf dasselbe Limit für Traffic-Anstiege angerechnet.
Richtlinien
Was passiert, wenn der Schnellmodus die angestrebte Latenz nicht erreicht?
Wende dich bei Fragen oder Bedenken bitte an deinen AD. Für die SLAs des Schnellmodus gelten dieselben Regeln wie für die SLAs des Scale Tier. Wenn wir diese SLAs innerhalb eines bestimmten Zeitfensters nicht erfüllen, erhalten Kunden mit Enterprise-Verträgen Servicegutschriften.
Ist der Schnellmodus mit Datenresidenz kompatibel?
Ja.
Ist der Schnellmodus mit ZDR und dem BAA kompatibel?
Ja.
