OpenAI
Esta página foi traduzida automaticamente. Veja o artigo original em inglês.

Perguntas frequentes sobre o modo Fast

Perguntas frequentes sobre o modo Fast

Atualizado: 18 hours ago

Oferecemos o modo Fast para clientes da API que buscam desempenho mais rápido e consistente em determinados modelos. Abaixo, você encontra respostas para perguntas frequentes sobre funcionamento, preços, disponibilidade de modelos, limites de taxa, confiabilidade, políticas e elegibilidade.

Observação: o processamento prioritário passou a se chamar modo Fast em 30 de julho de 2026. Você pode usar service_tier: priority ou service_tier: fast nas solicitações à API. 

Saiba mais aqui.

O modo Fast está disponível em todas as regiões?

A disponibilidade do modo Fast depende das leis e regulamentações aplicáveis em cada jurisdição. Se tiver dúvidas sobre a disponibilidade na sua região, entre em contato com seu diretor de conta.

Como funciona

Os clientes podem direcionar o tráfego para o modo Fast em cada solicitação usando o parâmetro service_tier existente, com a opção service_tier = "fast".

Os tokens processados pelo modo Fast serão cobrados por token, com preço superior às tarifas do processamento padrão.

Além da configuração no nível da solicitação, você também pode definir o modo Fast como padrão para um projeto em Configurações do projeto > Nível de serviço padrão: Fast. Ainda é possível substituir essa configuração em cada solicitação. Selecionar Fast nas configurações do projeto equivale a selecionar Priority.

Como isso funciona com o Nível de escala?

O Nível de escala continuará separado do modo Fast. As solicitações enviadas ao modo Fast serão cobradas separadamente e não serão descontadas dos pacotes de TPM do Nível de escala que você adquiriu.

Posso enviar automaticamente ao modo Fast o tráfego excedente do meu Nível de escala?

Não. O tráfego enviado ao Nível de escala não será redirecionado automaticamente ao modo Fast quando exceder a capacidade.

Como o modo Fast é cobrado?

Os tokens processados pelo modo Fast serão cobrados por token, com preço superior às tarifas do processamento padrão.

Meu compromisso anual está vinculado a um modo de processamento específico?

Não. Todos os modos de processamento contam para seu compromisso anual de gastos do Enterprise.

Ainda recebo desconto nos tokens de entrada em cache?

Sim! As entradas em cache recebem o mesmo desconto de 50% a 75% oferecido no processamento padrão.

Como consulto o uso e os gastos do modo Fast?

Para consultar os tokens processados pelo modo Fast (antigo processamento prioritário), acesse o painel de Uso, selecione Chat Completions ou Responses e agrupe por Nível de serviço.

Para consultar o custo do modo Fast, acesse o painel de Uso e selecione Agrupar por item de cobrança.

No painel de Uso, as solicitações que usam priority ou fast como service_tier continuarão aparecendo como priority. Isso será atualizado para modelos futuros.

Modelos

O modo Fast está disponível para contexto longo, modelos com ajuste fino, embeddings etc.?

Ainda não. No futuro, avaliaremos a possibilidade de oferecer o modo Fast em outros produtos além dos nossos modelos mais recentes.

Como outras modalidades funcionam com o modo Fast?

O modo Fast oferece os mesmos recursos multimodais disponíveis no processamento padrão. Em particular, imagens podem ser usadas como entradas no processamento prioritário e são processadas com a mesma baixa latência.

Haverá suporte para modelos futuros?

Planejamos oferecer o modo Fast em novos modelos GPT, mas não garantimos que todos os modelos terão suporte.

Limites de taxa

Quais são os limites de taxa?

Para fins de limites de taxa, o consumo do processamento prioritário é tratado da mesma forma que o tráfego padrão da API.

Quais são os limites de taxa de aumento?

O modo Fast tem limites de taxa de aumento para garantir um desempenho elevado e consistente para todos os clientes, sem abrir mão de preços flexíveis e sob demanda. Se (a) o desempenho do modo Fast estiver prejudicado E (b) o tráfego de um cliente estiver aumentando rápido demais, em casos raros algumas solicitações poderão ser rebaixadas para o processamento padrão.

O limite atual da taxa de aumento do modo Fast está definido aqui, na nossa documentação principal.

Práticas recomendadas para não exceder seu limite de taxa de aumento

Aumente o tráfego gradualmente ao trocar de modelo. Por exemplo, se seu aplicativo estiver migrando de um snapshot anterior para um novo, use um sinalizador de recurso para transferir o tráfego ao longo de algumas horas, em vez de fazer isso de uma só vez.

Evite executar grandes tarefas assíncronas ou de processamento de dados no modo Fast. Essas tarefas podem aumentar o tráfego muito rapidamente e, muitas vezes, não precisam do desempenho superior do modo Fast.

Se você atingir os limites de taxa de aumento com frequência, considere adquirir uma cota do Nível de escala.

Os limites de taxa de aumento são compartilhados entre meus projetos ou organizações?

Sim. Todo o seu tráfego contribui para o mesmo limite de taxa de aumento.

Políticas

O que acontece se o modo Fast não atingir a meta de latência?

Em caso de dúvidas ou preocupações, entre em contato com seu diretor de conta. Os SLAs do modo Fast serão tratados da mesma forma que os SLAs do Nível de escala. Se não cumprirmos esses SLAs em determinado período, ofereceremos créditos de serviço aos clientes com contratos Enterprise.

O modo Fast é compatível com residência de dados?

Sim.

O modo Fast é compatível com ZDR e BAA?

Sim.

Este artigo foi útil?