Ofrecemos el Modo rápido a los clientes de la API que desean un rendimiento más rápido y uniforme con determinados modelos. A continuación, respondemos a preguntas frecuentes sobre su funcionamiento, precios, disponibilidad de modelos, límites de solicitudes, fiabilidad, políticas y requisitos.
Nota: el Procesamiento prioritario pasó a llamarse Modo rápido el 30 de julio de 2026. Puedes usar service_tier: priority o service_tier: fast en tus solicitudes a la API.
Obtén más información aquí.
¿Está disponible el Modo rápido en todas las regiones?
La disponibilidad del Modo rápido depende de las leyes y normativas aplicables en cada jurisdicción. Si tienes dudas sobre la disponibilidad en tu región, ponte en contacto con tu director de cuenta.
Funcionamiento
Los clientes pueden dirigir el tráfico al Modo rápido en cada solicitud mediante el parámetro service_tier existente, con la opción service_tier = "fast".
Los tokens procesados mediante el Modo rápido se facturan por token, con un recargo respecto a las tarifas del Procesamiento estándar.
Además de configurarlo para cada solicitud, también puedes establecer el Modo rápido como opción predeterminada de un proyecto en Configuración del proyecto > Nivel de servicio predeterminado: Rápido. Aun así, puedes cambiar esta opción en cada solicitud. Seleccionar Rápido en la configuración del proyecto equivale a seleccionar Prioritario.
¿Cómo interactúa con el Nivel de capacidad?
El Nivel de capacidad seguirá siendo independiente del Modo rápido. Las solicitudes enviadas al Modo rápido se facturarán por separado y no se descontarán de los paquetes de TPM del Nivel de capacidad que hayas adquirido.
¿Puedo enviar automáticamente al Modo rápido el tráfico que exceda mi Nivel de capacidad?
No. El tráfico enviado al Nivel de capacidad no se desviará automáticamente al Modo rápido.
¿Cómo se factura el Modo rápido?
Los tokens procesados mediante el Modo rápido se facturan por token, con un recargo respecto a las tarifas del Procesamiento estándar.
¿Está mi compromiso anual vinculado a un modo de procesamiento concreto?
No. Todos los modos de procesamiento se contabilizan para tu compromiso de gasto anual de Enterprise.
¿Sigo obteniendo un descuento en los tokens de entrada almacenados en caché?
¡Sí! Las entradas almacenadas en caché reciben el mismo descuento del 50-75 % que con el Procesamiento estándar.
¿Cómo puedo consultar el uso y el gasto del Modo rápido?
Para consultar los tokens procesados mediante el Modo rápido (antes denominado Procesamiento prioritario), ve al panel Uso, selecciona Chat Completions o Responses y elige Agrupar por Nivel de servicio.
Para consultar el coste del Modo rápido, ve al panel Uso y selecciona Agrupar por partida.
En el panel Uso, las solicitudes cuyo service_tier sea priority o fast seguirán apareciendo como priority. Esto se actualizará para futuros modelos.
Modelos
¿Está disponible el Modo rápido para contextos largos, modelos con ajuste fino, embeddings, etc.?
Por ahora, no. En el futuro, evaluaremos si ofrecer el Modo rápido en más productos, además de nuestros modelos más recientes.
¿Cómo funcionan las demás modalidades con el Modo rápido?
El Modo rápido admite las mismas funciones multimodales que el modo Estándar. En concreto, las imágenes pueden usarse como entradas para el Procesamiento prioritario y se procesan con la misma baja latencia.
¿Se admitirán futuros modelos?
Tenemos previsto ofrecer el Modo rápido en nuevos modelos GPT, pero no garantizamos que sea compatible con todos los modelos.
Límites de solicitudes
¿Cuáles son los límites de solicitudes?
A efectos de los límites de solicitudes, el consumo del Procesamiento prioritario se trata igual que el tráfico estándar de la API.
¿Cuáles son los límites de aumento de tráfico?
El Modo rápido tiene límites de aumento de tráfico para garantizar un alto rendimiento uniforme a todos los clientes y, al mismo tiempo, ofrecer precios flexibles y bajo demanda. En casos excepcionales, si (a) el rendimiento del Modo rápido se degrada Y (b) el tráfico de un cliente aumenta demasiado deprisa, algunas solicitudes podrían pasar al Procesamiento estándar.
El límite actual de aumento de tráfico del Modo rápido se define aquí, en nuestra documentación principal.
Prácticas recomendadas para no superar el límite de aumento de tráfico
Aumenta el tráfico gradualmente al cambiar de modelo. Por ejemplo, si tu aplicación está migrando de una instantánea anterior a otra nueva, usa una marca de función para transferir el tráfico a lo largo de varias horas, en lugar de hacerlo de una sola vez.
Evita ejecutar grandes tareas de procesamiento de datos o trabajos asíncronos en el Modo rápido. Estas tareas pueden aumentar el tráfico muy deprisa y, a menudo, no necesitan el rendimiento mejorado del Modo rápido.
Si sueles alcanzar los límites de aumento de tráfico, considera adquirir una cuota del Nivel de capacidad.
¿Los límites de aumento de tráfico se comparten entre mis proyectos u organizaciones?
Sí, todo tu tráfico se contabiliza para el mismo límite de aumento de tráfico.
Políticas
¿Qué ocurre si el Modo rápido no cumple el objetivo de latencia?
Si tienes alguna duda o inquietud, ponte en contacto con tu director de cuenta. Los SLA del Modo rápido se tratarán igual que los del Nivel de capacidad. Si durante un periodo determinado no cumplimos esos SLA para clientes con contratos Enterprise, ofreceremos créditos de servicio.
¿Es compatible el Modo rápido con la residencia de datos?
Sí.
¿Es compatible el Modo rápido con ZDR y el BAA?
Sí.
