Oferujemy Tryb szybki klientom API, którzy potrzebują szybszego i bardziej przewidywalnego działania wybranych modeli. Poniżej znajdziesz odpowiedzi na częste pytania dotyczące jego działania, cen, dostępności modeli, limitów zapytań, niezawodności, zasad i warunków dostępu.
Uwaga: 30 lipca 2026 r. nazwa przetwarzania priorytetowego została zmieniona na Tryb szybki. W żądaniach API możesz używać zarówno service_tier: priority, jak i service_tier: fast.
Więcej informacji znajdziesz tutaj.
Czy Tryb szybki jest dostępny we wszystkich regionach?
Dostępność Trybu szybkiego zależy od prawa i przepisów obowiązujących w danej jurysdykcji. Jeśli masz pytania o dostępność w swoim regionie, skontaktuj się z opiekunem klienta.
Jak to działa
Klienci mogą kierować poszczególne żądania do Trybu szybkiego za pomocą istniejącego parametru service_tier, ustawiając service_tier = "fast".
Tokeny przetwarzane w Trybie szybkim będą rozliczane za każdy token według stawek wyższych niż w przetwarzaniu standardowym.
Oprócz konfiguracji na poziomie żądania możesz też ustawić Tryb szybki jako domyślny dla projektu, wybierając Ustawienia projektu > Domyślny poziom planu: Szybki. Nadal możesz zmienić to ustawienie dla poszczególnych żądań. Wybranie opcji Szybki w ustawieniach projektu jest równoważne z wybraniem opcji Priorytetowy.
Jak Tryb szybki współdziała z ofertą Skalowaną?
Oferta Skalowana pozostanie odrębna od Trybu szybkiego. Żądania kierowane do Trybu szybkiego będą rozliczane osobno i nie będą wliczane do wykupionych pakietów TPM w ofercie Skalowanej.
Czy mogę automatycznie kierować ruch przekraczający limity oferty Skalowanej do Trybu szybkiego?
Nie. Ruch kierowany do oferty Skalowanej nie będzie automatycznie przekierowywany do Trybu szybkiego po przekroczeniu limitów.
Jak rozliczany jest Tryb szybki?
Tokeny przetwarzane w Trybie szybkim będą rozliczane za każdy token według stawek wyższych niż w przetwarzaniu standardowym.
Czy moje roczne zobowiązanie do wydatków jest powiązane z konkretnym trybem przetwarzania?
Nie. Wydatki na wszystkie tryby przetwarzania wliczają się do rocznego zobowiązania do wydatków w ramach umowy Enterprise.
Czy nadal otrzymuję zniżkę na tokeny wejściowe z pamięci podręcznej?
Tak! Dane wejściowe z pamięci podręcznej są objęte taką samą zniżką 50–75% jak w przetwarzaniu standardowym.
Jak sprawdzić wykorzystanie Trybu szybkiego i związane z nim wydatki?
Aby sprawdzić tokeny przetworzone w Trybie szybkim (dawniej przetwarzaniu priorytetowym), przejdź do panelu Wykorzystanie, wybierz Chat Completions lub Responses, a następnie Grupuj według poziomu planu.
Aby sprawdzić koszty Trybu szybkiego, przejdź do panelu Wykorzystanie i wybierz Grupuj według pozycji rozliczeniowej.
W panelu Wykorzystanie żądania z wartością priority lub fast parametru service_tier nadal będą wyświetlane jako priority. Zostanie to zaktualizowane w przypadku przyszłych modeli.
Modele
Czy Tryb szybki jest dostępny dla długiego kontekstu, dostrojonych modeli, osadzeń itp.?
Obecnie nie. W przyszłości rozważymy udostępnienie Trybu szybkiego także w innych produktach, poza naszymi najnowszymi modelami.
Jak Tryb szybki obsługuje inne modalności?
Tryb szybki obsługuje te same funkcje multimodalne co przetwarzanie standardowe. W szczególności obrazy można przesyłać jako dane wejściowe do przetwarzania priorytetowego — są one przetwarzane z równie małym opóźnieniem.
Czy przyszłe modele będą obsługiwane?
Planujemy udostępniać Tryb szybki w nowych modelach GPT, ale nie gwarantujemy obsługi każdego modelu.
Limity zapytań
Jakie są limity zapytań?
Pod względem limitów zapytań wykorzystanie przetwarzania priorytetowego jest traktowane tak samo jak standardowy ruch API.
Jakie są limity narastania liczby zapytań?
W Trybie szybkim obowiązują limity narastania liczby zapytań, aby zapewnić wszystkim klientom niezmiennie wysoką wydajność przy zachowaniu elastycznych opłat za korzystanie na żądanie. Jeśli (a) wydajność Trybu szybkiego spadnie ORAZ (b) ruch klienta będzie wzrastać zbyt szybko, w rzadkich przypadkach niektóre żądania mogą zostać przekierowane do przetwarzania standardowego.
Aktualny limit narastania liczby zapytań w Trybie szybkim jest określony w naszej głównej dokumentacji dostępnej tutaj.
Jak unikać przekraczania limitu narastania liczby zapytań
Przy zmianie modelu zwiększaj ruch stopniowo. Jeśli na przykład Twoja aplikacja przechodzi z poprzedniej wersji modelu na nową, użyj flagi funkcji, aby przenosić ruch przez kilka godzin, zamiast przekierowywać go w całości od razu.
Unikaj uruchamiania w Trybie szybkim zadań przetwarzania dużych zbiorów danych i zadań asynchronicznych. Takie zadania mogą bardzo szybko zwiększać ruch, a często nie wymagają wyższej wydajności Trybu szybkiego.
Jeśli regularnie osiągasz limity narastania liczby zapytań, rozważ zamiast tego zakup przydziału w ramach oferty Skalowanej.
Czy limity narastania liczby zapytań są wspólne dla moich projektów lub organizacji?
Tak, cały Twój ruch jest uwzględniany w tym samym limicie narastania liczby zapytań.
Zasady
Co się stanie, jeśli Tryb szybki nie osiągnie docelowego czasu odpowiedzi?
W razie pytań lub wątpliwości skontaktuj się z opiekunem klienta. Umowy SLA dla Trybu szybkiego będą traktowane tak samo jak umowy SLA dla oferty Skalowanej. Jeśli w danym przedziale czasu nie dotrzymamy warunków tych umów wobec klientów z umowami Enterprise, zaoferujemy im środki na korzystanie z usługi.
Czy Tryb szybki jest zgodny z wymogami rezydencji danych?
Tak.
Czy Tryb szybki jest zgodny z ZDR i umową BAA?
Tak.
Ultrafast dla GPT-6 Astra
Ultrafast to osobny poziom planu przeznaczony do zastosowań wymagających krótszego czasu odpowiedzi GPT-6 Astra, takich jak aplikacje interaktywne i zadania programistyczne.
Informacje o cenach, limitach zapytań i zasadach Trybu szybkiego dotyczą żądań z ustawieniem service_tier="fast". Żądania Ultrafast korzystają z osobnego poziomu planu service_tier="ultrafast".
Jak wysłać żądanie Ultrafast?
Jeśli organizacja ma dostęp do Ultrafast, użyj interfejsu Responses API z następującymi ustawieniami:
Model:
gpt-6-astraPoziom planu:
ultrafastNagłówek żądania:
OpenAI-Service-Tier: ultrafast
Oprócz ustawienia poziomu planu wymagany jest nagłówek żądania.
W aplikacjach wywołujących narzędzia tryb WebSocket pozwala korzystać z tego samego połączenia w kolejnych turach i ograniczyć narzut związany z nawiązywaniem połączeń.
Czy mogę używać tego samego nagłówka żądania dla innych poziomów planu?
W fazie alfa Ultrafast nagłówek OpenAI-Service-Tier przyjmuje wyłącznie wartość ultrafast. Wysłanie innej wartości, w tym default, fast lub flex, powoduje zwrócenie błędu HTTP 400. Pomiń ten nagłówek, jeśli korzystasz z innego poziomu planu.
Czy mogę korzystać z Ultrafast w Work lub Codex?
Ultrafast jest też dostępny w Work i Codex w planach i obszarach roboczych spełniających warunki dostępu. Warunki dostępu i zasady korzystania w planach ChatGPT różnią się od tych obowiązujących w API.
Szczegóły dotyczące dostępności i korzystania znajdziesz w artykule ChatGPT Work i Codex.
